CEO của Unreal Engine quan sát mô hình thế giới mới nhất: Được điều khiển bởi mã code, mô hình video tạo hình ảnh
Trong những năm gần đây, các mô hình tạo video đã phát triển nhanh chóng về độ rõ nét, tính nhất quán thời gian và khả năng kiểm soát. Tuy nhiên, việc chỉ dự đoán các pixel tiếp theo khó có thể duy trì rõ ràng các ngữ nghĩa cấp cao như mục tiêu, quy tắc, quan hệ nhân quả - những yếu tố quyết định sự vận hành của một thế giới phức tạp. Một thực tế thường bị bỏ qua là video trò chơi không phải là bản thân thế giới, mà là kết quả hiển thị của một chương trình đang chạy.
Dựa trên quan sát này, nhóm nghiên cứu từ Phòng thí nghiệm AGI, Đại học West Lake và Đại học Công nghệ Nanyang đã đề xuất Mô hình Thế giới Mã (Code World Model), một mô hình thế giới mới lấy mô hình ngôn ngữ làm "bộ não". Ý tưởng cốt lõi là để tác nhân lập trình (coding agent) liên tục viết, gọi và sửa mã để duy trì và cập nhật trạng thái thế giới có thể thực thi. Trạng thái liên quan đến quan sát hiện tại sau đó được chuyển đổi thành proxy (đại diện trung gian) để hướng dẫn mô hình video tạo ra hình ảnh trực quan chi tiết.
Mô hình này phân chia rõ ràng trách nhiệm: kiến thức, mục tiêu, quy tắc và quan hệ nhân quả dài hạn do coding agent và mã phụ trách; ngoại hình, chi tiết chuyển động, ánh sáng và kết cấu do mô hình video phụ trách. Nói cách khác, phần đầu quyết định điều gì xảy ra trong thế giới, phần sau quyết định tất cả trông như thế nào.
Proxy đóng vai trò là cầu nối quan trọng, trích xuất thông tin cần thiết từ trạng thái thế giới và tổ chức nó thành một biểu diễn trực quan thô. Một trình biên dịch nhẹ, xác định sẽ kết xuất proxy thành video proxy, sau đó đưa cùng văn bản có cấu trúc vào mô hình video. Văn bản mô tả "ai, cái gì, làm gì", trong khi proxy quy định "ở đâu, di chuyển thế nào, camera quay ra sao".
Dữ liệu huấn luyện được lấy từ bản ghi thời gian chạy của trò chơi, đảm bảo sự liên kết chặt chẽ giữa video RGB mục tiêu, video proxy và văn bản. Nguyên mẫu hiện tại sử dụng GPT-5.6 Sol làm coding agent và MiniMax-H3 Ref2VA làm mô hình video nền tảng.
Kết quả thử nghiệm định tính cho thấy, mô hình có thể tuân theo các ràng buộc về vị trí nhân vật, quỹ đạo chuyển động và chuyển động camera do proxy chỉ định, đồng thời bổ sung kết cấu, ánh sáng và chuyển động cục bộ phong phú, ngay cả khi phong cách nghệ thuật và bản sắc khác xa với dữ liệu huấn luyện.
Tóm lại, Code World Model thay đổi cách tiếp cận: thay vì chỉ học "quan sát tiếp tục thế nào", nó tập trung vào việc duy trì thế giới là gì và tuân theo quy tắc nào trước khi tạo ra quan sát tiếp theo. Một thế giới sinh thành thực sự mở cần cả trí tưởng tượng trực quan của mô hình video và cơ chế thực thi có thể duy trì kiến thức, quy tắc và quan hệ nhân quả.
marsbit09/07 12:23