Vừa rồi, trí tuệ nhân tạo mã hóa đa dụng AVO của NVIDIA đã đạt điểm tuyệt đối trên ARC-AGI-3!
Nó đã hoàn thành tất cả 183 màn trong 25 môi trường trò chơi, chỉ mất tổng cộng 6624 bước, RHAE đạt 100.00.


Hãy nhớ rằng ARC-AGI-3 nổi tiếng là không theo quy tắc nào cả. Nó ném trực tiếp tác nhân AI vào một trò chơi lạ, không cung cấp luật lệ hay mục tiêu, buộc tác nhân phải tự nhấn, tự xem, tự đoán.
Có môi trường cho phép di chuyển lên/xuống/trái/phải, lòng vòng trong hành lang, va vào một khối màu xanh đen, toàn bộ màn hình sẽ xoay 90 độ; có môi trường thậm chí không cho di chuyển, chỉ có thể nhấp chuột, dựa vào cú nhấp để biến đổi màu sắc của lưới thành mẫu hình mục tiêu.


Mỗi môi trường có ít nhất sáu màn, càng về sau càng khó, màn đầu chỉ cần năm bước, màn thứ sáu có thể cần tới năm mươi bước.
Trong khi đó, tác nhân AI chỉ có một lưới 64×64 và vài nút bấm.
Các mô hình tiên phong lao vào 'cứng' thì hoàn toàn không xong.
AVO lần này sử dụng mô hình Claude Opus 5. Nhưng nếu để nó tự đi thi, điểm số chỉ đạt 30.16%, và đây đã là vị trí số một trên bảng xếp hạng chính thức.

ARC Prize đã phân tích bản ghi trận đấu của thế hệ trước, tổng kết ra ba loại lỗi điển hình.
- Thứ nhất: Hiểu cục bộ, không hiểu toàn cục.
- Thứ hai: Áp đặt cơ chế lạ vào những trò chơi quen thuộc.
- Thứ ba: Vượt qua màn chơi, nhưng không thực sự học được gì.
Loại thứ ba là tệ nhất. Opus từng chỉ mất 37 bước để thông màn đầu của ka59, nhưng hiểu biết của nó về cơ chế nhấp chuột ngay từ đầu đã sai. Khi vào màn thứ hai, nó vẫn ôm khư khư lý thuyết sai đó, cuối cùng mắc kẹt luôn.


Cách làm của NVIDIA là không động vào mô hình, chỉ thêm một lớp 'vỏ' bên ngoài.
Kết quả, cùng một Claude Opus 5, điểm số nhảy thẳng từ 30 lên điểm tuyệt đối.
Ngay lập tức, X (Twitter) nổ tung. Một bên là 'ARC-AGI-3 đã gục ngã', 'Đã đến lúc tìm bảng xếp hạng mới để leo rồi' tràn ngập màn hình, một bên là những lời thán phục NVIDIA quá đỉnh.
Theo đà này, bước nhảy vọt tiếp theo ở cấp độ mô hình, có lẽ không phải là chờ một mô hình mới, mà là chờ một lần cập nhật harness (bộ khung điều khiển).

Bước nhảy 100 điểm, tách ra chỉ có hai thứ
Vậy rốt cuộc NVIDIA đã lắp gì bên ngoài mô hình, có thể lấp đầy cả ba cái hố này một lúc?
Giống như DeepSeek Harness và Codex Harness đang nổi như cồn gần đây, AVO cũng quản lý một loạt vấn đề xung quanh mô hình.
Bao gồm cung cấp ngữ cảnh nào, cung cấp công cụ gì, lưu trạng thái ra sao, tiếp nhận phản hồi thế nào, bị kẹt thì làm gì, và khi ngữ cảnh đầy rồi thì tiếp tục như thế nào, v.v.

Cụ thể về cơ chế, thứ thực sự phát huy tác dụng là hai thứ.
Thứ nhất là bộ nhớ bền vững (Persistent Memory).
Điểm chí mạng của nhiệm vụ dài hạn là ngữ cảnh sẽ đầy.
Một khi đầy, ký ức của mô hình sẽ bị xóa sạch, những gì đã thử trước đó, con đường nào không đi được, kết quả profiler (công cụ phân tích) đưa ra là gì, tất cả đều biến mất.
Vòng tiếp theo bắt đầu, nó lại từ đầu dẫm lên những cái hố tương tự.
AVO sẽ lưu lại tất cả những thứ này: các phiên bản triển khai trước đó, kết quả đánh giá mỗi lần, đầu ra của trình biên dịch và bộ phân tích, quá trình suy luận tích lũy được đều ở trong đó.
Sau khi ngữ cảnh được đặt lại, tác nhân thông minh tiếp tục công việc từ trạng thái hiện tại, chứ không phải xây dựng lại toàn bộ quá trình tìm kiếm từ con số 0.
Thứ hai là bộ giám sát (Supervisor).
Tác nhân chính chịu trách nhiệm cắm cúi làm việc, xem gì, sửa gì, thử nghiệm gì, nộp cái gì đều do nó tự quyết định.
Bộ giám sát không làm việc, chỉ đứng bên cạnh theo dõi toàn bộ quỹ đạo tìm kiếm. Một khi phát hiện tiến triển bị đình trệ, hoặc tác nhân chính bắt đầu xoay vòng tại chỗ, lặp đi lặp lại những việc vô ích, nó sẽ ra tay kéo tác nhân chính hướng tới một chiến lược khác.
Còn một chi tiết.
AVO chạy ARC-AGI-3 toàn bộ sử dụng chế độ thuần văn bản (pure text modality), mỗi khung hình quan sát đưa cho mô hình là một lưới văn bản chính xác 64×64, không có một tấm ảnh nào, không đưa vào một token hình ảnh nào.
Nghĩa là, trong một trò chơi đầy rẫy pixel, mô hình từ đầu đến cuối chưa từng nhìn thấy hình ảnh.
Cơ chế này đổi lại là bảng điểm thành tích hoàn thành 183 màn trong 6624 bước, RHAE đạt điểm tuyệt đối.

Kết luận của NVIDIA từ đây là, năng lực dài hạn chưa bao giờ là thứ mô hình riêng lẻ sở hữu, mà là toàn bộ hệ thống kết hợp tạo nên.
Bộ nhớ quyết định những gì có thể lưu lại cho vòng tiếp theo, công cụ quyết định tác nhân thông minh có thể thực hiện hành động gì, phản hồi cho nó biết mình có đi sai đường không.
Và khi giả thuyết bị bác bỏ, khả năng quay lại và tiếp tục làm việc quyết định việc này có thể tiếp tục được thực hiện hay không.
Trước tiên nó cách mạng hóa chính NVIDIA
Điều thú vị là, AVO hoàn toàn không được tạo ra để chơi game. Chiến trường chính của nó là Tối ưu hóa toán tử GPU (GPU Operator Optimization).
Vào ngày 25 tháng 3 năm nay, NVIDIA đã tải lên arXiv một bài báo có tên 《AVO: Hệ số biến đổi dạng tác nhân hướng tới tìm kiếm tiến hóa tự chủ》.

Địa chỉ bài báo: https://arxiv.org/abs/2603.24517
Có hai từ khóa trong tiêu đề, một là 'tìm kiếm tiến hóa' (evolutionary search), một là 'hệ số biến đổi' (mutation operator).
Bản thân tìm kiếm tiến hóa không phức tạp. Nắm trong tay một loạt mã ứng viên, sửa đổi, chạy thử, giữ lại phiên bản nhanh nhất, rồi tiếp tục sửa đổi, đẩy từ thế hệ này sang thế hệ khác.
Bước phụ trách việc 'sửa đổi' này, trong thuật toán tiến hóa được gọi là hệ số biến đổi. Trước đây nó được cố định cứng, cách sửa do con người định trước; sau này đổi sang dùng LLM để sửa, cũng chỉ là điều chỉnh một lần và xuất ra một đoạn mã.
Cách làm của AVO là, thay toàn bộ hệ số biến đổi bằng một tác nhân thông minh tự chủ.

Nhờ vậy, nó không chỉ có thể tra cứu hướng dẫn lập trình CUDA và tài liệu kiến trúc PTX, chạy thử nghiệm, đọc profiler, mà còn có thể tự chẩn đoán lỗi tính đúng đắn, sau đó quyết định phiên bản tiếp theo sẽ sửa chỗ nào.
Nhóm nghiên cứu đặt nó lên B200, nhiệm vụ là tối ưu hóa kernel (nhân) chú ý (attention), đây là toán tử bị vắt kiệt nhất trong Transformer. Rồi con người buông tay.
AVO liên tục chạy tự chủ trong 7 ngày, khám phá hơn 500 hướng tối ưu hóa, cuối cùng nộp 40 phiên bản kernel hiệu quả.
Kernel chú ý đa đầu (multi-head attention) chạy ra, nhanh hơn cuDNN độc quyền của chính NVIDIA tới 3.5%, nhanh hơn triển khai mã nguồn mở tiên phong nhất FlashAttention-4 tới 10.5%.
Sau đó nó lại chuyển bộ tối ưu hóa này lên GQA, kiến trúc chủ đạo của các mô hình lớn hiện nay. Lần này chỉ chạy tự chủ khoảng 30 phút, kernel mới đã nhanh hơn cuDNN 7.0%, nhanh hơn FlashAttention-4 9.3%.
Viết kernel CUDA bằng tay luôn là công việc có ngưỡng cửa cao nhất trong hệ sinh thái này, và AVO là cái đầu tiên vượt qua chính nó.


Và 25 trò chơi trong ARC-AGI-3, sử dụng chính hệ thống này.
Điều chỉnh kernel và chơi game, nghe có vẻ là hai việc hoàn toàn không liên quan. Nhưng trong mắt NVIDIA, hai việc này chạy dưới cùng một vòng lặp.
Tác nhân thông minh trước tiên đưa ra một giả thuyết từ bằng chứng không đầy đủ, bắt tay vào thử, quan sát kết quả, lưu lại trạng thái hữu ích, rồi điều chỉnh hiểu biết của mình về vấn đề. Nếu giả thuyết sai thì quay lại suy nghĩ lại, rồi lăn tiếp từng vòng.
Nói theo ngôn ngữ của chính NVIDIA, thứ có thể chuyển giao không phải là kiến thức lĩnh vực, mà là cơ chế duy trì việc tự chủ thúc đẩy tiến trình dài hạn đó.
Tạo ra nó là một đội ngũ gốc Á
Kéo danh sách tác giả của bài báo AVO ra, bạn sẽ thấy một chuỗi tên rất quen thuộc.
23 người ký tên, gần như tập hợp đủ các nhân vật then chốt của cơ sở hạ tầng học sâu mã nguồn mở trong mười năm qua.
Một trong những đồng tác giả đầu tiên, Bing Xu (Hứa Băng), là Kỹ sư Xuất sắc (Distinguished Engineer) của NVIDIA, cũng là tác giả của MXNet. Sớm hơn nữa, ông còn là tác giả thứ tư của bài báo GAN nguyên bản năm 2014, cùng với tác giả cuối Yoshua Bengio cùng đứng tên dưới trường Đại học Montreal.
Tianqi Chen (Trần Thiên Kỳ), tác giả của TVM và XGBoost cũng có tên trong danh sách. Đường dây TVM còn kéo theo Luis Ceze, hai người cùng sáng lập OctoAI được NVIDIA mua lại vào tháng 9/2024, Ceze sau đó gia nhập NVIDIA tiếp tục làm trình biên dịch học máy.
Tiếp theo là Zihao Ye (Diệp Tử Hào), tác giả của FlashInfer, và Vinod Grover, người tiên phong về trình biên dịch CUDA.
Đứng đầu là Humphrey Shi (Thạch Hồng Phi), Phó chủ tịch AI hiệu suất cao của NVIDIA, đồng thời là giáo sư tại Viện Công nghệ Georgia. Một đồng tác giả đầu tiên khác, Zhifan Ye (Diệp Chí Phàm), chính là nghiên cứu sinh tiến sĩ đang học tại Viện Công nghệ Georgia.
Blog lần này có năm tên ký, bốn người là gốc Á, ngoài Humphrey Shi còn có Terry Chen (Trần Đức Lợi), Zhifan Ye (Diệp Chí Phàm) và Yeyin Zhu (Chu Dạ Ngân), người còn lại là Jean-Francois Puget, bậc thầy Kaggle Grandmaster hai lần vô địch của NVIDIA.

Đoạn thú vị nhất đến từ lời kể của chính Bing Xu (Hứa Băng) trước đây trên X.
Một năm rưỡi trước, khi ông và Terry Chen (Trần Đức Lợi) mới bắt đầu làm lập trình tác nhân thông minh tại NVIDIA, cả hai đều không biết lập trình GPU.
Chính vì không biết, họ từ ngày đầu tiên đã hướng tới một hệ thống hoàn toàn tự động, không cần con người can thiệp, và đặt tên cho con đường này là 'lập trình mù' (blind programming).
Một năm rưỡi sau, hệ thống không dựa vào chỉ huy của con người này, đã vượt qua kernel mà các chuyên gia con người tối ưu hóa trong nhiều tháng.

Cuối cùng, mọi khoản đều quy về card đồ họa của 'Lão Hoàng'
Một công ty bán card đồ họa, tại sao lại dành một năm rưỡi để làm một tác nhân thông minh không cần con người can thiệp?
Bởi vì lớp 'vỏ' này, có thể lắp vào mô hình của ai cũng được.
AVO đã chạy qua nhiều mô hình khác nhau. Cùng một màn chơi, ghép với GPT-5.6 Sol thì tốn ít thời gian hơn, đổi thành Opus 5 thì tiết kiệm bước hơn.
NVIDIA không kiếm tiền bằng việc bán mô hình, nhưng nó có thể chiếm giữ tầng này. Điều này cũng nhất quán với định hướng tổng thể của họ trong hai năm qua.
Ở phía mô hình, đi theo hướng mã nguồn mở. Nemotron 4 thúc đẩy vào tháng 8 năm nay nhắm tới quy mô nghìn tỷ tham số, dự kiến hoàn thành huấn luyện vào mùa thu, tặng miễn phí mô hình, thu tiền ở GPU và phần mềm sau đó.
Ở phía sức mạnh tính toán, tác nhân thông minh dài hạn chính là tải trọng mà họ muốn nhất. Phán đoán của Jensen Huang ('Lão Hoàng') tại GTC năm nay là, điểm uốn suy luận (inference) đã đến. Hai năm qua nhu cầu sức mạnh tính toán tăng khoảng mười nghìn lần, trong khi mức độ sử dụng chỉ tăng khoảng một trăm lần, chênh lệch ở giữa hoàn toàn bị suy luận 'ăn' hết.
Vì vậy, dùng mô hình của hãng nào không quan trọng. Chỉ cần công việc của tác nhân thông minh càng làm càng dài, càng làm càng nặng, cuối cùng mọi khoản sẽ đều quy về card đồ họa của họ.
Còn ba chữ '100 điểm', trước mắt thực sự đang mất giá nhanh chóng.
Tháng 3 chưa ai có thể đạt 1 điểm, Tycho cuối tháng 7 đã đầu tiên lấy điểm tuyệt đối, VISTA ngày 5/8 lại lấy thêm một lần nữa, bảng điểm của AVO này đã là bảng thứ ba trong sáu tuần, và cả ba đều nhất loạt được điều khiển bởi Claude Opus 5.

Nhưng việc AVO làm được sẽ không vì thế mà giảm giá trị.
Một kiến trúc được sinh ra để vắt kiệt vài phần trăm cuối cùng của FlashAttention trên B200, gần như nguyên vẹn được chuyển sang một trò chơi pixel, rồi chạy thông.
Ở giữa chỉ thay đổi giao diện nhiệm vụ và cách thức đánh giá, vòng lặp cốt lõi đó không sửa một dòng nào.
Như NVIDIA đã viết ở cuối blog, Mô hình rất quan trọng, nhưng mô hình không phải là toàn bộ tác nhân thông minh.
Tài liệu tham khảo:
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
Bài viết này đến từ tài khoản công chúng WeChat 'New Zhiyuan', tác giả: ASI Apocalypse, biên tập: Moses






