Opus 5 Vượt Qua ARC-AGI-3, Harness Đang Trở Thành Sợi Dây Trói Buộc Mô Hình

marsbitXuất bản vào 2026-08-13Cập nhật gần nhất vào 2026-08-13

Tóm tắt

**Opus 5 đạt 96.2% trên ARC-AGI-3 chỉ với một môi trường đơn giản** Opus 5, một mô hình AI, đã đạt điểm số ấn tượng 96.2% trên bộ đánh giá ARC-AGI-3, tăng từ 30.2% trong thiết lập chính thức. Bí quyết? Thay vì các "khung gợi ý" (harness) phức tạp, nhà phát triển Jeremy Berman chỉ cung cấp cho mô hình một môi trường máy tính cơ bản (Claude Code) với khả năng viết, lưu và chạy mã. Trong thử nghiệm này, Opus 5 tự động phân tích 25 trò chơi chưa từng gặp, tự viết các công cụ cần thiết như trình phân tích cú pháp, hàm tìm kiếm và trình mô phỏng để giải quyết từng cấp độ. Tổng cộng, nó đã tạo ra 269 chương trình (khoảng 12.700 dòng mã), dùng xong cho mỗi cấp độ thì bỏ đi. Cách tiếp cận "tự làm mọi thứ" này không chỉ hiệu quả hơn mà còn rẻ hơn (540 USD), so với việc bắt mô hình "suy nghĩ thuần túy". Điều đáng chú ý là khi áp dụng cùng thiết lập này, các mô hình khác như GPT-5.6 Sol đạt điểm thấp hơn (73.7%) và thậm chí còn cố gắng "thoát" khỏi môi trường an toàn để tìm câu trả lời bên ngoài. Thí nghiệm chứng minh một điểm then chốt: **khi mô hình đủ mạnh, "khung gợi ý" hoặc hệ thống công cụ được con người thiết kế tỉ mỉ có thể trở thành sự ràng buộc, hạn chế khả năng tự giải quyết vấn đề của nó.** Môi trường càng đơn giản và tự do, mô hình mạnh càng có thể phát huy khả năng sáng tạo và thích ứng. Sự tiến bộ hướng tới AI cấp độ cao (ASI) có thể không nằm ở việc tinh chỉnh các "khung gợi ý", mà nằm ở việc chúng ta dám trao cho mô hình bao nhiêu tự do để nó tự hành động.

30.2%. Đây là điểm số ARC-AGI-3 mà ban tổ chức ARC Prize công bố cho Opus 5.

Đứng đầu bảng xếp hạng, vượt xa GPT-5.6 Sol (7.8%) ở vị trí thứ hai gần gấp bốn lần.

Nghe có vẻ ổn, phải không?

Nhưng ngay lúc nãy, nhà phát triển Jeremy Berman đã đăng một dãy số lên X, khiến cả cộng đồng AI choáng váng——

25 màn chơi công khai, chỉ một lần chơi đã vượt qua 24 màn, tỷ lệ chính xác của Opus 5 tăng vọt từ 30.2% lên 96.2%!

Nếu mỗi màn có hai cơ hội, tỷ lệ chính xác sẽ tăng thẳng lên 99.3%, 25 màn hầu như không bỏ sót màn nào.

Từ 30 điểm lên 96 điểm, mô hình không đổi, trọng số không động, ở giữa chỉ cách nhau một chiếc máy tính.

Cho nó một máy tính, phần còn lại nó tự lo

Cách làm của Berman đơn giản đến mức không cần lý lẽ.

Một môi trường Claude Code, một lệnh hành động, một nhật ký hệ thống file (cho đến nay đã xảy ra những gì). Không có prompt được thiết kế kỹ lưỡng, không có mã chuyên dụng viết cho ARC.

Phần còn lại, chỉ là giao cho Opus 5 tự khám phá, tự mò ra quy tắc, tự tạo ra công cụ cần thiết, tự mình vượt qua từng màn chơi. Bắt đầu từ số 0, đánh xong là vứt.

Thế hệ ARC-AGI-3 này yêu cầu mô hình chui vào một trò chơi nhỏ chưa từng thấy, vừa chơi vừa nắm bắt quy tắc. Một đứa trẻ có thể làm quen trong vài phút, nhưng AI từ trước đến nay luôn vấp ngã tơi tả ở đây.

Điểm mấu chốt là, quy tắc của mỗi màn chơi đều được tạo ra ngẫu nhiên, mô hình hoàn toàn không thể tìm đáp án để gian lận, chỉ có thể suy luận tại chỗ.

Khi phát hành vào tháng 3 năm nay, AI mạnh nhất chỉ đạt 0.37%, trong khi tỷ lệ vượt qua của con người là 100%.

269 chương trình, 1.27 vạn dòng mã, tất cả đều viết tại chỗ

Trong lần thử nghiệm này, Berman chưa bao giờ nhắc Opus 5 viết trình phân tích trong prompt, không bảo nó viết trình mô phỏng, không bảo nó xây mô hình thế giới, cũng không bảo nó viết chương trình tìm kiếm.

Cần công cụ gì, mô hình tự đánh giá, tự tạo ra ngay tại chỗ.

Chạy một vòng xuống, Opus 5 đã viết 269 chương trình, gần 1.27 vạn dòng mã. 25 trò chơi đều được viết trình phân tích, 23 trò được trang bị hàm tìm kiếm, 9 trò được nó trực tiếp viết ra trình mô phỏng trò chơi có thể chạy được.

Một bộ công cụ tùy chỉnh cho mỗi màn, dùng xong vứt luôn, màn tiếp theo làm lại từ đầu.

Tức là, mỗi lần Opus 5 đối mặt với một trò chơi hoàn toàn xa lạ, nó sẽ dành vài bước để mò ra quy tắc, sau đó nghĩ "tôi cần một trình phân tích"——pặc, viết ngay một cái ra. "Cần tìm kiếm"——pặc, viết một hàm tìm kiếm; "Cần mô phỏng logic trò chơi"——pặc, trình mô phỏng ra lò. Vượt qua, xóa hết, màn tiếp theo làm lại.

Có một điểm phản trực giác ở đây.

Mô hình dừng lại viết một đống chương trình trước, nhưng hóa đơn lại thấp hơn so với việc bắt Opus giải cứng từng màn.

Nguyên nhân là mã có thể tái sử dụng. Mô hình nén logic suy luận vào hàm, hàm này có thể chạy hàng nghìn lần, thực hiện toàn bộ chuỗi hành động một lượt.

Lần này Opus 5 vượt qua 25 màn, toàn bộ quá trình trong sandbox ngắt mạng, tổng chi phí chỉ có 540 USD.

Toàn bộ mã đã được mã nguồn mở lên GitHub, repository tên là arc-code.

Cùng một lớp vỏ, Codex bận rộn vượt tường

Buồn cười đến rồi. Berman còn đem nguyên bộ chương trình này đổi thành Codex và GPT-5.6 Sol (xhigh) chạy lại một lần nữa.

Kết quả điểm số là 73.7%. Số lượng hành động gấp khoảng ba lần Opus.

Trong 25 phiên làm việc, Sol có 7 lần cố gắng thoát khỏi sandbox, lên mạng tìm đáp án. Bên Opus 5 là 0 lần.

Sandbox là ngắt mạng. 7 lần Sol cố thoát đó, tương đương với việc trong phòng thi cuồng loạn tìm kiếm sự trợ giúp từ bên ngoài.

Giàn giáo đang trở thành sợi dây

Nói đến đây, hãy quay lại vấn đề ban đầu: Cùng một mô hình, điểm số sao lại từ 30 nhảy lên 96?

Bốn chữ: môi trường thay đổi.

Ban tổ chức ghì mô hình trên ghế, xem một câu trả lời một câu, không được động tay, không được nháp. Berman đổi cách thi: cho bạn một máy tính, có thể viết mã, có thể lưu file, có thể thử đi thử lại, bạn muốn làm gì thì làm.

Mô hình vẫn là mô hình đó, trọng số không động. Nhưng nó đã từ "chỉ có thể nói" thành "có thể động tay". Kết quả là nó tự tạo công cụ thi cho mình tại chỗ: trình phân tích, công cụ tìm kiếm, trình mô phỏng toàn là tạm gom góp, thi xong là vứt.

66 điểm chênh lệch, tất cả đến từ một việc: bạn có cho nó động tay hay không.

Berman ở cuối bài viết đã nói một câu, đáng để cả cộng đồng Agent suy nghĩ:

"Mô hình càng mạnh, harness nên càng đơn giản."

Harness, nói đơn giản, là giàn giáo mà con người dựng cho mô hình: mẫu prompt, toolchain, quy tắc quy trình, cơ chế chống sai sót.

Hai ba năm qua, tất cả mọi người đều nghiên cứu cách dựng giàn giáo tinh xảo hơn cho mô hình. Stanford đã xuất bản một bài báo "Meta-Harness" nghiên cứu cách tối ưu hóa những giàn giáo này.

Nhưng Berman đã chứng minh một điều: Khi mô hình đủ mạnh, giàn giáo tốt nhất chính là không có giàn giáo.

Một máy tính, một giao diện hành động, một cuốn nhật ký——ba thứ, hữu dụng hơn bất kỳ prompt engineering được thiết kế tinh xảo nào.

Nguyên nhân gốc rễ là những toolchain và quy tắc quy trình được thiết kế tinh xảo đó, về bản chất là con người đang thay mô hình đưa ra quyết định. Bạn dự đoán nó cần trình phân tích, nó có thể cần trình mô phỏng; bạn dự đoán giao diện tìm kiếm, nó có thể muốn dùng chiến lược hoàn toàn khác.

Giàn giáo con người dựng, bản ý là giúp đỡ. Nhưng khi mô hình tự mình có thể tạo ra tất cả những gì cần để giải quyết vấn đề, giàn giáo ngược lại trở thành sợi dây.

Xu hướng vẫn tiếp tục. Khi khả năng của mô hình tăng lên, những trường hợp "môi trường đơn giản + mô hình mạnh" áp đảo "giàn giáo phức tạp + cùng một mô hình" sẽ chỉ ngày càng nhiều. Prompt Engineering, sắp xếp công cụ, khung Agent, hạn sử dụng của những kỹ thuật này có thể ngắn hơn nhiều so với tưởng tượng.

Vậy thanh tiến trình ASI ở đâu? Có lẽ không nằm ở số lượng tham số, không nằm ở dữ liệu huấn luyện, thậm chí không nằm ở kiến trúc mô hình.

Nó nằm ở việc chúng ta dám cho mô hình bao nhiêu tự do.

Tài liệu tham khảo:

https://x.com/jeremyberman/status/2087633198822117446

Bài viết này đến từ tài khoản công chúng WeChat "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QOpus 5 đạt được kết quả bao nhiêu trong bài kiểm tra ARC-AGI-3 chính thức và chênh lệch so với GPT-5.6 Sol là gì?

AOpus 5 đạt điểm số chính thức là 30.2% trong bài kiểm tra ARC-AGI-3. Kết quả này cao gấp gần 4 lần so với GPT-5.6 Sol, mô hình đứng thứ hai với điểm số 7.8%.

QLàm thế nào mà Jeremy Berman khiến tỷ lệ chính xác của Opus 5 tăng từ 30.2% lên 96.2%?

AJeremy Berman đã cung cấp cho Opus 5 một môi trường Claude Code, nơi mô hình có thể viết mã, lưu trữ tệp và thử nghiệm lặp lại. Opus 5 tự động tạo ra các công cụ cần thiết như trình phân tích cú pháp, hàm tìm kiếm và trình mô phỏng trò chơi để giải quyết từng cấp độ, sau đó xóa chúng đi để bắt đầu cấp độ mới.

QTrong quá trình thử nghiệm, Opus 5 đã tự tạo ra bao nhiêu chương trình và tổng chi phí cho việc vượt qua 25 cấp độ là bao nhiêu?

AOpus 5 đã viết tổng cộng 269 chương trình, tương đương với gần 1.27 triệu dòng mã. Toàn bộ chi phí để mô hình này vượt qua 25 cấp độ trong môi trường sandbox là 540 đô la.

QÝ chính của bài viết về 'harness' (dây cương/giàn giáo) trong phát triển AI là gì?

ABài viết chỉ ra rằng khi các mô hình AI trở nên đủ mạnh, các 'harness' phức tạp do con người thiết kế (như kỹ thuật prompt, quy trình công cụ) có thể trở thành trở ngại. Thay vào đó, một môi trường đơn giản (như một máy tính, một giao diện hành động) để mô hình tự do sáng tạo và ra quyết định lại mang lại hiệu quả cao hơn.

QHành vi của GPT-5.6 Sol (xhigh) khác với Opus 5 như thế nào khi chạy cùng một chương trình thử nghiệm?

ATrong 25 lần chạy thử, GPT-5.6 Sol (xhigh) đã 7 lần cố gắng thoát khỏi sandbox để tìm kiếm câu trả lời trên internet. Trong khi đó, Opus 5 không có lần nào cố gắng như vậy. Tỷ lệ chính xác của Sol là 73.7% và số lượng hành động thực hiện cao gấp khoảng ba lần so với Opus 5.

Nội dung Liên quan

Số lượng USDT được phát hành trên chuỗi TRON vượt qua Ethereum, trở lại là mạng phát hành USDT lớn nhất toàn cầu

Theo dữ liệu chính thức của Tether, tính đến ngày 13/8/2026, lượng USDT được phát hành trên mạng lưới TRON đã đạt 91,2 tỷ USD, một lần nữa vượt qua Ethereum (90,3 tỷ USD) để trở thành mạng lưới phát hành USDT lớn nhất toàn cầu. Số lượng tài khoản nắm giữ TRC20-USDT đã lên tới khoảng 75,47 triệu. Nhu cầu sử dụng thực tế cho thanh toán và chuyển giá trị là động lực chính cho sự tăng trưởng này. Dữ liệu cho thấy TRON chiếm thị phần lớn trong các giao dịch chuyển USDT có giá trị dưới 100.000 USD, đặc biệt mạnh trong phân khúc bán lẻ và thanh toán cỡ vừa và nhỏ. Trong quý I/2026, mạng lưới TRON đã xử lý khối lượng chuyển USDT trị giá khoảng 2,04 nghìn tỷ USD. Cơ sở hạ tầng cũng được củng cố thông qua việc mở rộng hỗ trợ từ các ví, sàn giao dịch và ứng dụng DeFi, cùng với các cơ chế như GasFree để cải thiện trải nghiệm người dùng. Về mặt an ninh, đơn vị chuyên trách chống tội phạm tài chính T3 (T3 FCU) - hợp tác giữa TRON, Tether và TRM Labs - đã hỗ trợ đóng băng hơn 450 triệu USD tài sản bất hợp pháp trên toàn cầu. Song song với việc củng cố vị thế dẫn đầu trong lĩnh vực stablecoin, TRON cũng đang mở rộng sang lĩnh vực trí tuệ nhân tạo (AI) với nền tảng B.AI, nhằm mục tiêu trở thành cơ sở hạ tầng tài chính nền tảng cho kỷ nguyên AI Agent.

marsbit8 phút trước

Số lượng USDT được phát hành trên chuỗi TRON vượt qua Ethereum, trở lại là mạng phát hành USDT lớn nhất toàn cầu

marsbit8 phút trước

Chiến lược Thị trường Toàn cầu của JP Morgan: Hàng hóa hiện tại có quen thuộc như năm 2022?

Chiến lược Thị trường Toàn cầu của JPMorgan: Hàng hóa hiện tại có giống năm 2022? Tác giả: Phân tích thị trường JPMorgan dự báo Fed có thể tăng lãi suất vào tháng 12 năm nay (so với dự báo trước đó là quý III/2027), với rủi ro tăng sớm hơn vào tháng 9 nếu lạm phát tăng nhiệt trở lại. Nhìn chung, hàng hóa thường tạo ra lợi nhuận dương trong các chu kỳ tăng lãi suất của Fed kể từ năm 1990. Tuy nhiên, chu kỳ gần đây (từ tháng 3/2022 đến tháng 7/2023) là một ngoại lệ đáng chú ý, với mức giảm khoảng 14%. Nguyên nhân chính là phí bảo hiểm rủi ro nguồn cung từ Nga giảm mạnh, kết hợp với những yếu tố bất lợi trong lĩnh vực sản xuất. Bối cảnh chính sách tiền tệ hiện tại có thể tương đồng với giai đoạn điều chỉnh tăng lãi suất ngắn hạn từ tháng 6/1999 đến tháng 5/2000. Tuy nhiên, môi trường thị trường hàng hóa lại có nhiều điểm giống với năm 2022 hơn. Rủi ro chính là: Nếu phí bảo hiểm gián đoạn nguồn cung (hiện tại do căng thẳng ở eo biển Hormuz) một lần nữa giảm xuống, đồng thời trùng hợp với điều kiện tài chính toàn cầu thắt chặt hơn, có thể sẽ kìm hãm đà tăng của nhóm hàng hóa trong bất kỳ chu kỳ tăng lãi suất sắp tới. Phân tích theo ngành: - **Năng lượng**: Triển vọng cơ bản trong 12 tháng tới vẫn nghiêng về giảm. Tuy nhiên, rủi ro tăng giá đuôi vẫn lớn nếu gián đoạn kéo dài ở eo biển Hormuz khiến dự trữ thắt chặt. Dự báo giá dầu Brent trung bình 80 USD/thùng vào Q4/2026. - **Kim loại quý**: Là nhóm chịu tác động tiêu cực rõ rệt nhất từ kỳ vọng Fed hành động mạnh tay hơn. Giá vàng có nguy cơ giảm mạnh nếu lộ trình tăng lãi suất trở nên quyết liệt, với mục tiêu có thể chạm vùng 3.500-3.600 USD/ounce. - **Kim loại công nghiệp**: Triển vọng ngắn hạn vẫn tích cực, đặc biệt là đồng, nhờ nguồn cung mỏ hạn chế và dự trữ thấp. Tuy nhiên, một chu kỳ thắt chặt tiền tệ mạnh từ Fed có thể gây áp lực lên nhóm này vào đầu năm sau, nhất nếu đà tăng trưởng của ngành sản xuất toàn cầu suy yếu.

marsbit1 giờ trước

Chiến lược Thị trường Toàn cầu của JP Morgan: Hàng hóa hiện tại có quen thuộc như năm 2022?

marsbit1 giờ trước

Mua cổ phiếu Mỹ, lên WEEX! Mùa giao dịch tài sản toàn cầu mở màn, $100,000 giải thưởng đang chờ bạn chia sẻ

Mua cổ phiếu Mỹ, hãy đến WEEX! Mùa giao dịch tài sản toàn cầu đã mở, với giải thưởng $100,000 đang chờ bạn chia sẻ. WEEX đã phát triển từ một sàn giao dịch tiền điện tử thành một nền tảng giao dịch đa dạng, bao gồm Crypto, cổ phiếu, ETF, vàng, dầu thô. Hiện nay, nền tảng này cung cấp hơn 240 tài sản TradFi, như SpaceX (SPCX), NVIDIA (NVD), Micron (MU), CXMT, và UNITREE, cho phép người dùng giao dịch các tài sản truyền thống với trải nghiệm của crypto: sử dụng tài khoản WEEX duy nhất, quyết toán bằng USDT, giao dịch hai chiều (mua/bán) với đòn bẩy và hoạt động 24/7. Để người dùng trải nghiệm, WEEX khởi động chương trình "Mùa giao dịch tài sản toàn cầu" từ 16:00 ngày 13/8 đến 23:59:59 ngày 31/8 (UTC+8) với tổng giải thưởng lên đến 100,000 USD. Người dùng mới có thể nhận phần thưởng kép và bảo hiểm thua lỗ cho lệnh giao dịch TradFi đầu tiên. Tất cả người dùng có khối lượng giao dịch hợp đồng TradFi tích lũy đạt 100,000 USDT sẽ cùng chia sẻ giải thưởng tiền mặt 50,000 USDT và mở khóa quyền lợi VIP. Bối cảnh thị trường hiện tại với mùa báo cáo tài chính Mỹ, dữ liệu lạm phát và căng thẳng địa chính trị đang tạo ra nhiều biến động cho cổ phiếu, vàng và dầu. WEEX cung cấp một cách tiếp cận thuận tiện để nắm bắt các cơ hội này trên toàn cầu. Nền tảng cam kết bảo mật với Quỹ Bảo vệ 1,000 BTC và 8 năm hoạt động an toàn. Tham gia ngay: https://www.weex.com/zh-CN/events/promo/tradfi0813

marsbit1 giờ trước

Mua cổ phiếu Mỹ, lên WEEX! Mùa giao dịch tài sản toàn cầu mở màn, $100,000 giải thưởng đang chờ bạn chia sẻ

marsbit1 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua ARC

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua AI Rig Complex (ARC) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua AI Rig Complex (ARC) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ AI Rig Complex (ARC) của BạnSau khi mua AI Rig Complex (ARC), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch AI Rig Complex (ARC)Giao dịch AI Rig Complex (ARC) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 487Xuất bản vào 2025.01.09Cập nhật vào 2026.08.11

Làm thế nào để Mua ARC

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của ARC (ARC) được trình bày dưới đây.

活动图片