Không nói nhiều, bắt đầu ngồi thư giãn mỗi ngày thôi (doge)!
Vừa mới đây, chuyên gia Karpathy thông báo, "chúng tôi" tại Anthropic đã bắt đầu sử dụng một cách hoàn toàn mới để thử thách mô hình lớn——
《Chúa tể của những chiếc nhẫn》.

Theo Karpathy giới thiệu, bộ "chuẩn Chúa tể những chiếc nhẫn" này đang thay thế bài kiểm tra SVG "chim bồ nông đi xe đạp" từng thịnh hành trước đây.

Cụ thể, Karpathy trực tiếp đưa phần mở đầu của 《Chúa tể của những chiếc nhẫn》 cho Opus 5, yêu cầu mô hình sử dụng Three.js để "tạo ra" cả một "Trung Đồ Thế Giới" ngay tại chỗ.
Về hiệu quả cuối cùng, có phần giống như những bộ phim hoạt hình 3D sản xuất trong nước vào cuối những năm 90 và đầu những năm 2000: rất thô sơ, cũng rất trừu tượng.
Nhưng khách quan mà nói, nếu xem kỹ một lúc, và nếu bạn cũng quen thuộc với Hobbiton, địa điểm quay phim 《Chúa tể của những chiếc nhẫn》 tọa lạc tại New Zealand, thực sự có thể cảm nhận được một chút hương vị đó~
Tuy nhiên, thứ có vẻ không tinh xảo này lại thực sự tiêu tốn của Opus 5: 1 triệu token,2 giờ đồng hồ và 5500 dòng code.
Dĩ nhiên, trên sân khấu không chỉ có một mình Claude lộng lẫy.
Vui nhất có lẽ là phiên bản V4 Flash của
DeepSeek mà cộng đồng mạng mới "dâng lên".
Cả một màn "người Trung Quốc có thể bay", nhân vật trong khung hình bay lơ lửng hết.
Đối mặt với những lỗi hiển nhiên bằng mắt thường này, Karpathy cũng tỏ ra khá khách quan.
Ông chỉ ra, Opus 5 hiện vẫn chưa thể thực sự "bước vào" thế giới do chính mình tạo ra, chỉ có thể chụp ảnh màn hình ở các thời điểm khác nhau, rồi từ từ kiểm tra xem vấn đề nằm ở đâu.
Và điều này chính xác đã phơi bày một điểm yếu rõ ràng của các mô hình lớn hiện tại:
Chúng đã có thể viết code, dựng cảnh, tạo game, nhưng vẫn chưa thể thực sự xem hiểu video, cũng không tự mình chơi thử game do chính mình tạo ra.
Hai giờ đồng hồ, thủ công tạo nên một Trung Đồ
Đầu tiên hãy xem thử nghiệm "Chúa tể những chiếc nhẫn" cụ thể được thực hiện như thế nào.
Nếu theo đúng nghĩa đen của tweet của Karpathy, lời nhắc chính được nhập vào Opus 5 lần này, chính là phần mở đầu chương đầu tiên của 《Chúa tể của những chiếc nhẫn》, "Bữa tiệc mong chờ đã lâu".

Bilbo Baggins ở Bag End tuyên bố sẽ tổ chức một bữa tiệc sinh nhật 111 tuổi hoành tráng, Hobbiton lập tức xôn xao bàn tán......
Bạn nào có hứng thú có thể tự mình thử.
Ngoài ra, Karpathy còn chỉ định Three.js trong lời nhắc, tức là một thư viện JavaScript dùng code để dựng cảnh 3D.
Từ đó, nhiệm vụ của Opus 5 là trước tiên đọc hiểu văn bản mở đầu của 《Chúa tể của những chiếc nhẫn》, sau đó dịch nó thành một thế giới 3D có thể chạy thời gian thực trong trình duyệt.

Trong toàn bộ quá trình, Opus 5 cần sử dụng các đa giác để ghép thành nhân vật, kiến trúc và đạo cụ, đặt chúng lần lượt vào hệ tọa độ x, y, z, rồi sắp xếp máy quay, ánh sáng và hoạt ảnh.
Nhân vật di chuyển khi nào, máy quay xoay về đâu, ánh sáng thay đổi ra sao, vật thể trong cảnh tương tác thế nào, tất cả đều cần mô hình dùng code để định nghĩa.
Mặc dù hình ảnh cuối cùng không thể nói là tinh xảo, và thường xuyên xuất hiện các vấn đề như xuyên mô hình, bay lơ lửng, chẳng hạn như thân và đầu nhân vật tách rời...... nhưng toàn bộ bối cảnh ít nhất đã được dựng lên một cách thực sự.

Cần lưu ý, đây không phải là việc mô hình video trực tiếp tạo ra từng khung hình pixel.
Three.js cần xây dựng nhân vật, vật thể và cảnh vật trước như các đối tượng ba chiều, sau đó tính toán vị trí, góc độ và trạng thái chuyển động của chúng theo thời gian thực dựa trên code.
Vì vậy, Demo chúng ta thấy không phải là một video AI tạo ra thông thường, mà là bản ghi màn hình khi một cảnh 3D trên web đang chạy.
Tuy nhiên, Karpathy cũng nhắc đến trong phần bình luận, 3D thủ tục và tạo video không phải là chọn một trong hai.
Có cư dân mạng đề xuất, có thể đưa bản ghi Three.js thô sơ này cho Seedance làm video tham khảo, rồi để mô hình video render lại một lần nữa với chất lượng hình ảnh cao hơn.

Karpathy nhanh chóng đồng ý.
Theo ý tưởng của ông, code thủ tục có thể chịu trách nhiệm phân cảnh và điều khiển, trước tiên xác định xương sống như nhân vật đứng ở đâu, máy quay di chuyển thế nào, cốt truyện tiến triển ra sao.
Tiếp theo, đưa bản ghi màn hình cho mô hình Video-to-Video, để nó bổ sung thêm kết cấu, ánh sáng và chi tiết, nâng cao "hình thức" của toàn bộ Trung Đồ Thế Giới.
Còn về âm thanh, Opus 5 lần này không bao gồm luôn.
Karpathy cho biết, do yêu cầu cá nhân về chất lượng âm thanh, cuối cùng sử dụng ElevenLabs.

Thế là, Demo 《Chúa tể của những chiếc nhẫn》 có hình ảnh, có cảnh quay, còn có lời bình ở phần mở đầu, đã ra đời như vậy.
Karpathy cũng đã mở mã nguồn toàn bộ dự án, đường link cụ thể có thể tham khảo cuối bài.

Cư dân mạng thú vị hơn Karpathy nhiều
Ngay sau khi Karpathy tung ra Demo, nhiều cư dân mạng cũng tới thử nghiệm.
Nhìn chung lại, chỉ có thể nói:
Cư dân mạng lần này giàu trí tưởng tượng hơn Karpathy nhiều.
Có người dùng Claude khởi động một dự án 「Earth Online」, mục tiêu là dựa vào một nhóm AI Agent, xây dựng dần dần cả Trái Đất.
Hiện tại, Agent chưa tạo xong cả Trái Đất, chỉ dựng được một khu vực ven biển San Francisco phong cách low-poly. Nhưng từ hình ảnh hiện có, tỷ lệ kiến trúc, kích thước nhân vật và phong cách tổng thể đều được duy trì khá thống nhất.
Hiệu quả này hơi giống loại phim hoạt hình thế giới Lego. Phong cách không phức tạp, nhưng nhân vật, cảnh vật và hành động có thể vận hành ổn định trong cùng một thế giới.
Theo hướng này tiếp tục, phim hoạt hình và game nhẹ phong cách đơn giản, đã có chút hình hài nguyên bản AI.
Lại có cư dân mạng dùng Fable 5 và GPT-5.6 Sol dựng mô hình số 3D thành phố New York, và kết nối dữ liệu thời gian thực vào đó.
Mô hình không chỉ cần sắp xếp đúng đường phố và kiến trúc của New York, mà còn phải duy trì mối quan hệ không gian giữa các khu vực khác nhau. Tác giả cũng từ đó đề xuất, nhiệm vụ tạo thế giới ảo này có lẽ có thể trở thành một Benchmark suy luận không gian mới.
Vẫn chưa hết, còn có chuyện cường điệu hơn nữa.
Có cư dân mạng không mua được vé concert Kanye West, liền dùng AI trong trình duyệt tự tổ chức bù cho mình một buổi.
Toàn bộ dự án vẫn do Three.js dựng nên. Chỉ có một tệp HTML, không gọi bất kỳ mô hình 3D có sẵn nào, sân khấu, nhân vật và ánh sáng đều do code tạo ra.
Cả buổi concert chuẩn bị tổng cộng 14 bài hát, mỗi bài đều có thiết kế ánh sáng riêng và một bộ hình ảnh sân khấu hình cầu đặc trưng.
Người dùng thông thường có thể nghe thử đoạn ngắn, sau khi kết nối Spotify Premium, còn có thể phát bài hát đầy đủ và toàn bộ buổi diễn.
Không mua được vé, trực tiếp tự tạo cho mình một buổi bao rạp, quá đỉnh!
Vẫn chưa xong!!!
Karpathy ở cuối bài gốc còn mơ mộng, sau này có thể thêm cách chơi vào những thế giới 3D này, để người chơi bước vào đó với tư cách người quan sát, NPC hay thậm chí là nhân vật trong câu chuyện.
Kết quả là phiên bản game chưa kịp Karpathy sắp xếp, cư dân mạng đã làm ra rồi.

Dự án này cũng sử dụng Opus 5 và Three.js, không chỉ có thể chạy và tương tác, mà âm thanh cũng được trang bị.
Nhiều ví dụ thiết kế 3D khác cũng liên tục xuất hiện. Từ tỷ lệ kiến trúc, bố cục không gian đến phong cách cảnh vật, Opus 5 đã có thể duy trì tính nhất quán tương đối ổn định trong các dự án có quy mô không nhỏ.
Còn nhiều ví dụ tương tự, ở đây không tiện trình bày từng cái.
Khách quan mà nói, những tác phẩm này vẫn còn khoảng cách với game thực sự trưởng thành.
Cách chơi hoa mắt có thú vị không, vận hành lâu dài có ổn định không, người chơi có thực sự sẵn sàng ở trong đó 15 phút hay không, hiện tại đều chưa có câu trả lời.
Nhưng ngưỡng cửa sản xuất nội dung 3D thời gian thực và nguyên mẫu có thể chơi được, thực sự đã được đẩy xuống thấp hơn một bậc lớn.
Hơn nữa, có một phương pháp mới để kiểm tra năng lực mô hình, đồng thời lại đủ thú vị, đủ hay để chơi, chẳng phải rất tuyệt sao?
Chim bồ nông, đã đi đến cuối đường
Vậy, tại sao đột nhiên lại bắt mô hình lớn tạo ra 《Chúa tể của những chiếc nhẫn》?
Điều này phải nói từ bài kiểm tra "chim bồ nông đi xe đạp" nổi như cồn vài năm trước.
Đề bài này ban đầu đến từ nhà phát triển Simon Willison, yêu cầu chỉ có một câu:
Tạo một hình ảnh SVG chim bồ nông đi xe đạp.

Mặc dù đề bài trông có vẻ đơn giản, nhưng thực ra nó khá thử thách mô hình.
Bởi vì SVG trông là một bức ảnh, nhưng tầng dưới lại là một chuỗi code.
Mô hình không chỉ cần biết chim bồ nông và xe đạp trông như thế nào, mà còn phải tách chúng thành các đường nét, hình tròn và đa giác, rồi dùng tọa độ sắp xếp mối quan hệ vị trí của từng bộ phận.

Quan trọng hơn, bản thân chim bồ nông và xe đạp không mấy hợp nhau.
Khung xe, lốp và bàn đạp xe đạp phải giữ cấu trúc hình học chính xác; chim bồ nông thì có mỏ lớn, chân ngắn, và một thân hình nhìn sao cũng không giống dạng đạp xe.

Kết hợp hai thứ lại, mô hình có thực sự hiểu quan hệ không gian hay không, gần như có thể nhìn ra ngay:
Bánh xe có lệch không, chân có đạp trúng bàn đạp không, chim thực sự đang đạp xe, hay là bị khung xe phân thây ngay tại chỗ.
Hãy xem những demo cuối năm 24 ở trên đi~
Chính vì thế, "chim bồ nông đi xe đạp" từng trở thành bài kiểm tra kinh điển trong dân gian để quan sát khả năng hiểu không gian, kết hợp vật thể và tạo code của mô hình lớn.

Nhưng cùng với việc mô hình ngày càng mạnh, con chim bồ nông này cũng sắp đi đến cuối đường rồi.
Nhìn biểu hiện của
DeepSeek R1 và
DeepSeek V4 dưới đây sẽ biết, mô hình hiện nay đã có thể hoàn thành đề bài này khá giống như thật.

Quan trọng hơn, một tấm SVG chỉ có thể kiểm tra đầu ra một lần của mô hình.
Nó không đo được mô hình có thể lập kế hoạch cho một dự án phức tạp, làm việc liên tục nhiều giờ, và liên tục kiểm tra và sửa lỗi của chính mình trong hàng nghìn dòng code hay không.
Thế là, Karpathy đổi một đề bài nhỏ "vẽ một bức tranh", thành một công trình lớn "dựng một thế giới"——
Chim bồ nông có thể xuống xe rồi, Trung Đồ Thế Giới chính thức tiếp nhận.

Chim bồ nông của Karpathy
Nhanh chóng, tin tức Karpathy chuẩn bị đổi đề cho "bài kiểm tra chim bồ nông" cũng lan truyền đến các cộng đồng lớn.
Bình luận được đánh giá cao trên Hacker News cho rằng, mặc dù chất lượng hình ảnh của các Demo này đều rất bình thường, nhưng điều này lại chứng tỏ, chúng ta cần một bài kiểm tra mới khó hơn việc tạo một bức ảnh đơn lẻ.
Chuẩn mới không nên chỉ xem mô hình có vẽ đúng tranh không, mà còn phải kiểm tra nó có hiểu một thế giới hay không.

Xét cho cùng, "chim bồ nông đi xe đạp" đã được dùng quá lâu.
Các mô hình liên tục luyện tập cho các nhiệm vụ loại này, khoảng cách giữa chúng ngày càng khó nhận ra.
Ngược lại, việc tạo ra một thế giới 3D hoàn chỉnh đòi hỏi mô hình hiểu mối quan hệ không gian giữa nhân vật và vật thể, xử lý máy quay, hành động và sự thay đổi cảnh vật, chứ không phải đơn giản gọi mô hình tạo video để nhả ra một đoạn hình ảnh.

Dĩ nhiên, cũng có người đưa ra ý kiến phản đối.
Bài kiểm tra chim bồ nông đủ ngắn gọn, chi phí thấp, kết quả cũng dễ so sánh.
Để kiểm tra một lần mô hình, tiêu hao nhiều Token như vậy để tạo cả một thế giới 3D, có phần giống như dùng sức tính toán để đốt pháo hoa.

Đồng thời, việc bản thân Three.js có thể đánh giá năng lực tổng hợp của mô hình lớn hay không, cũng bị nghi ngờ.
Có người cho rằng, các Demo loại này nhiều nhất chỉ chứng minh Anthropic đã huấn luyện khá tốt trên code Three.js, không thể nói mô hình thực sự hiểu không gian và thế giới vật lý.
Nhưng nhanh chóng có cư dân mạng phản bác:
Chuyển đổi một văn bản văn học trừu tượng, ý nghĩa mơ hồ thành hoạt hình 3D, mô hình cần đồng thời xử lý quan hệ không gian, quy luật vật lý, vật thể thường ngày, cùng các vấn đề toán học trong biến đổi 3D và đồ họa máy tính.
Nếu như vậy vẫn chỉ tính là "biết viết Three.js", thì có phần đánh giá thấp 5500 dòng code này.

Lại có cư dân mạng đưa ra một vấn đề mở hơn:
Cái gọi là "suy luận không gian", thực sự có khác với suy luận khi mô hình lớn thường xử lý văn bản, code không?
Một quan điểm cho rằng, việc hình ảnh có thành lập hay không, phụ thuộc vào việc mô hình có hiểu các quan hệ không gian như "trước sau, trong ngoài, xa gần, che khuất" hay không, cũng như khoảng cách, góc độ và kích thước tương đối của vật thể ở các góc nhìn khác nhau.

Nhưng một quan điểm khác cho rằng, bất kể mô hình xử lý là "bên cạnh hòn đá", hay là "trong mảng", có lẽ đều làm cùng một việc: tạo ra từng Token một dựa trên ngữ cảnh, và hoàn thành suy luận trong quá trình này.
Nếu là như vậy, thì điều Opus 5 thể hiện không chỉ là một "khả năng không gian" đột nhiên xuất hiện.
Tình huống có thể xảy ra hơn là, khả năng suy luận phổ quát vốn dùng để hiểu văn bản và code của mô hình ngôn ngữ lớn, đã bắt đầu tự nhiên mở rộng đến thế giới ba chiều.
Từ việc vẽ một con chim bồ nông, đến dựng nên một Trung Đồ Thế Giới, đề bài trông có vẻ thay đổi, nhưng có lẽ điều được kiểm tra đằng sau vẫn luôn là cùng một vấn đề:
Mô hình có thể chuyển đổi sự hiểu biết của mình về thế giới thành một cấu trúc thực sự có thể vận hành hay không.
Và cuối cùng, có lẽ còn có một vấn đề cường điệu hơn nữa——
Nếu mô hình lớn phổ quát đã có thể tự viết code dựng thế giới 3D, rồi gọi các API như Seedance, ElevenLabs để hoàn thành hình ảnh và âm thanh, thì người dùng còn bao nhiêu sự cần thiết, để tự mình mở một sản phẩm tạo video chuyên dụng để nhập Prompt?
Tài liệu tham khảo
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
Bài viết này đến từ tài khoản công chúng WeChat "Quantum Bit", tác giả: henry






