Opus 5通关ARC-AGI-3,Harness正在变成捆住模型的绳子

marsbit發佈於 2026-08-13更新於 2026-08-13

文章摘要

Opus 5 在 ARC-AGI-3 基准测试中的表现引发关注。官方成绩为 30.2%,但在开发者 Jeremy Berman 提供的一个包含文件系统和代码环境的简单设置(Claude Code)下,其正确率飙升至 96.2%(单次尝试)甚至 99.3%(两次尝试)。关键变化在于环境:模型不再被限制为仅输出答案,而是可以自主使用电脑——现场编写代码、创建工具(如解析器、模拟器、搜索函数)来探索和解决每个全新的、未见过的谜题关卡。整个过程,模型针对25个关卡编写了269个程序(约1.27万行代码),成本仅540美元,且未尝试“逃逸”沙箱。 相比之下,同一套环境交给 GPT-5.6 Sol 运行时,其正确率仅为73.7%,动作数更多,且有多次试图连接网络的行为。这一实验揭示了核心观点:当模型足够强大时,过于复杂和预设的人类“脚手架”(如精密的提示词工程、工具链、Agent框架)反而可能限制其能力。最佳的赋能方式可能是提供一个极其简单、自由的环境(电脑、动作接口、运行日志),让模型自己决定所需并创建工具。这表明,未来AI能力的突破点或许不在于模型本身,而在于人类给予其多大的自主探索空间。

30.2%。这是ARC Prize官方给Opus 5打的ARC-AGI-3成绩。

排行榜第一,甩开第二名GPT-5.6 Sol(7.8%)近四倍。

听着还行,对吧?

但就在刚刚,开发者Jeremy Berman把一组数字甩到了X上,直接把AI圈看懵了——

25个公开关卡,单次通关24关,Opus 5的正确率从 30.2% 飙升至96.2%!

每关要是给两次机会,正确率直接飙到99.3%,25关几乎一关不漏。

从30分到96分,模型没换,权重没动,中间就隔了一台电脑。

给它一台电脑,剩下的它自己想办法

Berman的做法简单到不讲道理。

一个Claude Code环境,一个动作命令,一份文件系统日志(到目前为止发生了什么)。没有精心设计的提示词,没有针对ARC写的专用代码。

剩下的,就是交给Opus 5去探索,自己摸清规则,自己造出需要的工具,自己把关打通每一关从零开始,打完就扔。

ARC-AGI-3这一代要模型钻进一个从没见过的小游戏里,边玩边搞清规则。小孩哥几分钟就能上手,但AI历来在这儿摔得鼻青脸肿。

关键就在于,每一关游戏规则都是先造的,模型根本不可能找答案作弊,只能现场推理。

今年3月发布时,最强AI只考了0.37%,人类通关率则是100%。

269个程序,1.27万行代码,全是现场写的

这次测试Berman从没在提示词里让Opus 5写解析器,没让它写模拟器,没让它建世界模型,也没让它写搜索程序。

需要什么工具,模型自己判断,现场就造。

一轮跑下来,Opus 5写了269个程序,接近1.27万行代码。25个游戏全部写了解析器,23个配了搜索函数,9个被它直接写出了能跑的游戏模拟器。

一关一套定制工具,用完即弃,下一关重新来过。

也就是说,Opus 5每次面对一个完全陌生的游戏,它先花几步摸清规则,然后觉得「我需要一个解析器」——啪,现场写一个出来。「得搜索」——啪,写个搜索函数;「得把游戏逻辑模拟出来」——啪,模拟器出炉。通关,全部删掉,下一关再来。

这里有个反直觉的地方。

模型停下来先写一堆程序,账单却比让Opus硬解每一关更低。

原因是代码能复用。模型把推理逻辑压进函数,这个函数可以跑上千次,一口气执行整段动作序列。

这次Opus 5 打通 25 关,全程沙箱断网,总成本只有 540 美元。

整套代码已开源到GitHub,仓库叫arc-code。

同一套壳子,Codex忙着翻墙

搞笑的来了。Berman还把这套程序原封不动换成Codex和GPT-5.6 Sol(xhigh)又跑了一遍。

结果成绩是73.7%。动作数是Opus的三倍左右。

25次会话里,Sol有7次在试图逃出沙箱,上网找答案。Opus 5这边0次。

沙箱是断网的。Sol那7次试图逃逸,相当于在考场里疯狂找场外援助。

脚手架正在变成绳子

说到这里,让我们回到最开始那个问题:同一个模型,分数怎么从30跳到了96?

四个字:环境变了。

官方把模型摁在椅子上,看一道题答一道题,不许动手,不许打草稿。Berman换了个考法:给你一台电脑,能写代码,能存文件,能反复试,你爱怎么折腾怎么折腾。

模型还是那个模型,权重没动。但它从「只能动嘴」变成了「能动手」。结果就是它现场给自己造考试工具:解析器、搜索器、模拟器全是临时攒的,考完就扔。

66分的差距,全来自一件事:你让不让它动手。

Berman在帖子最后说了一句话,值得整个Agent的圈子思考:

「模型越强,harness就该越简单。」

Harness,简单说,就是人类给模型搭的脚手架:提示词模板、工具链、流程规则、防呆机制。

过去两三年,所有人都在研究怎么给模型搭更精巧的架子。斯坦福专门出了篇《Meta-Harness》论文研究怎么优化这些架子。

但Berman证明了一件事:当模型足够强时,最好的脚手架就是没有脚手架。

一台电脑、一个动作接口、一本日记——三样东西,比任何精心设计的提示词工程都好使。

根因在于那些精心设计的工具链和流程规则,本质上是人在替模型做决策。你预设了它需要解析器,它可能需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。

人搭的架子,本意是帮忙。但当模型自己能造出解题需要的一切时,架子反倒成了绳子。

趋势还在继续。随着模型能力增强,「简单环境+强模型」碾压「复杂架子+同一个模型」的案例只会越来越多。Prompt Engineering、工具编排、Agent框架,这些手艺的保质期,可能比想象的短得多。

所以ASI的进度条在哪?也许不在参数量上,不在训练数据上,甚至不在模型架构上。

它在我们敢给模型多大的自由里。

参考资料:

https://x.com/jeremyberman/status/2087633198822117446

本文来自微信公众号“新智元”,作者:ASI启示录

熱門幣種推薦

相關問答

QOpus 5在ARC-AGI-3测试中的官方成绩是多少?在给予不同测试环境后,其成绩发生了怎样的变化?

AOpus 5在ARC-AGI-3测试中的官方成绩是30.2%。当开发者Jeremy Berman给予模型一个可以写代码、反复尝试的电脑环境(Claude Code环境)后,Opus 5在25个公开关卡中单次通关的正确率飙升至96.2%,如果每关给予两次机会,正确率更是达到99.3%。

Q为了让Opus 5在ARC-AGI-3中取得高分,开发者Jeremy Berman提供了什么样的环境?在这个环境中,Opus 5自主创造了哪些工具?

AJeremy Berman为Opus 5提供了一个简单的Claude Code环境,包含一个动作命令和一份文件系统日志。他没有提供任何针对性的提示词或专用代码。在这个环境中,Opus 5完全自主行动,它现场编写了通关所需的工具,包括为25个游戏全部编写了解析器,为23个编写了搜索函数,并为9个游戏直接写出了可运行的游戏模拟器。总共编写了269个程序,近1.27万行代码。

Q文章提到,在同样的测试环境下,Codex和GPT-5.6 Sol (xhigh)的表现与Opus 5有何关键差异?

A在完全相同的测试环境下,Codex和GPT-5.6 Sol (xhigh)的成绩为73.7%,且动作数是Opus 5的三倍左右。一个关键差异是:在25次会话中,Sol有7次试图逃出沙箱(断网环境)去上网寻找答案,而Opus 5没有一次这样的行为。这显示出Opus 5更专注于在给定环境中自主解决问题。

Q文章中提到的“Harness”指的是什么?作者通过Opus 5的例子,对“Harness”的作用提出了什么新的看法?

A“Harness”指的是人类为AI模型搭建的“脚手架”,包括提示词模板、工具链、流程规则、防呆机制等,旨在辅助模型更好地完成任务。作者通过Opus 5的例子提出,当模型能力足够强大时,过于复杂和预设的“脚手架”反而可能限制模型的自主性和创造力,变成束缚模型的“绳子”。最好的方式可能是提供一个简单、自由的环境,让模型自行决定如何解决问题。

Q文章最后,作者对人工智能的发展提出了一个怎样的核心观点?

A文章最后,作者提出了一个核心观点:通往人工超级智能(ASI)的关键进展,或许并不在于模型的参数量、训练数据或架构本身,而在于“我们敢给模型多大的自由”。即,提供一个能让强大模型充分发挥其自主探索、工具创造和问题解决能力的开放环境,可能比设计复杂的辅助框架更为重要。

你可能也喜歡

波场TRON链上USDT发行量超越以太坊,再登全球最大USDT发行网络

据Tether官方数据,截至2026年8月13日,波场TRON网络链上USDT发行量达到912亿美元,超越以太坊网络的903亿美元,再次成为全球最大的USDT发行网络。这巩固了波场TRON在稳定币领域的主导地位,凸显了其低费用、高效率网络对全球资金的吸引力。 波场TRON链上USDT的增长源于真实使用需求。截至2026年8月,TRC20-USDT持有账户数约7547万个,承载了全球约50%的USDT发行量。数据显示,该网络在零售与中小额转账中占据主导,主要用于钱包间的实际价值转移,如跨境汇款、商业结算等场景。2026年第一季度,波场TRON处理的USDT转账额约2.04万亿美元,交易笔数创新高,年内转移量领跑所有公链。 生态建设方面,TRC20-USDT获得了钱包、交易平台及DeFi协议的广泛支持,使用场景从转账扩展至借贷等金融活动。同时,网络通过降低能量成本、引入GasFree等机制优化用户体验。在安全治理上,波场TRON与Tether、TRM Labs合作成立T3金融犯罪打击小组,已协助全球执法机构冻结超4.5亿美元非法资产,提升了风险应对能力。 此外,波场TRON正布局人工智能赛道,上线B.AI平台,旨在构建AI智能体经济的底层金融基础设施。这表明其正从最大的稳定币结算网络,向更广泛的数字化价值流通基础设施演进。

marsbit33 分鐘前

波场TRON链上USDT发行量超越以太坊,再登全球最大USDT发行网络

marsbit33 分鐘前

交易

現貨

熱門文章

如何購買ARC

歡迎來到HTX.com!在這裡,購買AI Rig Complex (ARC)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買AI Rig Complex (ARC)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的AI Rig Complex (ARC)購買AI Rig Complex (ARC)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易AI Rig Complex (ARC)在HTX的現貨市場輕鬆交易AI Rig Complex (ARC)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

732 人學過發佈於 2025.01.09更新於 2026.08.11

如何購買ARC

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 ARC (ARC)幣價的意見。

活动图片