刚刚,Claude Fable 5,又拿第一了

marsbit发布于2026-08-04更新于2026-08-04

文章摘要

刚刚,Claude Fable 5在最新的MirrorCode AI编程能力排行榜上,以64%的绝对成功率断层式登顶。排名第二的GPT-5.6 Sol成绩仅为它的三分之一。更引人注目的是,Fable 5在处理Go等热门语言与Ada等冷门语言时,解出率分别为64%和61%,相差仅3个百分点,尽管网络上的Python语料量大约是Ada的230倍。这表明顶尖模型可能已不再依赖对特定语言语料的记忆,而是掌握了从零构建完整软件项目的核心能力。 MirrorCode评测环境严苛,模型需在隔离网络且无法查看源码的情况下,通过反复调用和观察原程序来推理并复现其全部功能。评测要求可见与隐藏测试完成率必须达到100%,并允许模型消耗高达100亿Token、连续运行数天以完成任务。例如,在复现一个约1.6万行的生物信息学工具时,Claude Opus 4.7在14小时内通过了2000项测试(完成度99.95%),而人类工程师完成同等任务估计需2到17周。 当前,AI正从编写单段代码转向承担整个项目级任务。例如,已有数百个AI Agent协作编写超百万行浏览器代码,或搭建能编译Linux内核的C编译器。数据显示,大量用户已开始委托AI完成预计超过数小时甚至数日的开发工作。MirrorCode的64%通过率量化了这种“项目级委托”的可行性:只要目标明确且能自动验收,前沿模型已能独立完成部分中大型软件。 这意味着,未来开发者的角色可能从逐行监工转变为在关键节点进行方向和结果的把控。代码的生产成本将越来越低,而清晰定义问题与准确验收结果的能力将愈发珍贵。

Claude这次,真把AI编程榜单打出断层了!

就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。

紧追其后的GPT-5.6 Sol,分数只有它的三分之一!

排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。

更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。

要知道,在开源世界里,Python语料大约是Ada的230倍。

但到了Fable 5这里,成绩居然只下降3个百分点。

这就有意思了。

如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。

而现在的结果,却指向另一种可能——

最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。

卡死在100%通关线,100亿Token极限测试

具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。

在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。

接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一 点点 写出一个行为一致的新程序。

最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。

并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。

只要漏掉一个边缘案例,整次运行仍然按失败计算。

为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。

论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。

在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。

整个过程,更像一场持续数天的调试,而不是一次生成。

gotree的例子最直观。

这个生物信息学工具原本有大约1.6万行Go代码和40多个命令。

Claude Opus 4.7花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%。

虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几个小时——

Epoch估计,如果不使用AI,人类工程师想要完成同一任务至少需要2到17周。

语料荒漠里,Fable 5只掉了3分

MirrorCode论文曾用StarCoder的公开训练混合作为参照。

其中Python约占8%,Ada只有0.034%,前者大约是后者的230倍。

当然,我们无法知道闭源模型到底见过多少Ada代码。但拿公开生态作参照,Ada有多稀缺已经足够直观。

这门语言主要出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。

而Fable 5显然不是在把Go代码逐句翻译成Ada。

它更像是先摸清原程序究竟怎么工作,再换一门语言,把同样的行为重新造出来。

相比之下,其他模型就没这么稳了。

GPT-5.6 Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5更是从17%掉到5%。语言一换,差距立刻被放大。

把整个项目交给AI

如今,Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码。

Anthropic则让16个Claude Agent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux 6.9内核的C编译器。

OpenAI披露的截至5月Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务;25.6%提交过超过八小时的任务。

人们交给AI的单位,正在从一段代码、一个bug,变成一个下午、一周,甚至整个项目。

MirrorCode的64%,正是对这种「项目级委托」的一次量化。

它说明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立做完一部分中大型软件。

对每一个正在把工作交给AI的人来说,变化已经近在眼前——

以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。

代码会越来越便宜。

而那些能把问题说清楚、把结果验明白的人,会越来越值钱。

参考资料:https://epoch.ai/MirrorCode

本文来自微信公众号“新智元”,作者:ASI启示录;编辑:摩西

热门币种推荐

相关问答

Q在最新的MirrorCode排行榜上,Claude Fable 5的成功率是多少?紧追其后的GPT-5.6 Sol分数又是多少?

A在最新的MirrorCode排行榜上,Claude Fable 5的成功率是64%。紧追其后的GPT-5.6 Sol分数只有它的三分之一,即大约21.33%。

Q文章中提到,在使用Go和Ada语言时,Claude Fable 5的解出率分别是多少?这说明了模型的什么能力?

A在使用Go语言时,Claude Fable 5的解出率是64%;换成冷门语言Ada后,成绩仍然高达61%。这说明Fable 5可能已经超越了单纯记忆和模仿热门语言代码的模式,具备了从零构建完整软件项目、深刻理解程序逻辑并跨语言实现相同行为的能力。

QMirrorCode基准测试对模型通关的要求是什么?它如何确保测试的严格性?

AMirrorCode基准测试要求模型必须达到100%的可见测试与隐藏测试完成率才算通过,即使完成99.9%也会被判定为失败。它通过将模型置于隔离环境(无网络、无法查看源码和第三方依赖)、提供高层文档和部分测试、允许调用原程序进行反向工程,并设置了极高的单次计算预算(高达100亿Token和最长连续运行7天甚至19天)来确保测试的极端严格性。

Q文章中提到Claude Opus 4.7在复现‘gotree’工具时取得了什么成绩?这个成绩的意义是什么?

AClaude Opus 4.7在复现大约1.6万行Go代码的‘gotree’生物信息学工具时,花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%,仅因漏掉一个处理日期注释的边界案例而未能达到100%通关线。这个成绩的意义在于,它将原本需要人类工程师2到17周的工作量压缩到了十几个小时,展现了AI在复杂软件工程任务上巨大的效率潜力。

Q根据文章,当前AI编程能力的发展,正在导致软件行业中什么趋势的变化?

A根据文章,当前AI编程能力的快速发展(如能独立完成中大型软件项目),正在导致软件行业的趋势发生变化:代码的生产成本将变得越来越便宜。与此同时,那些具备“能把问题说清楚、把结果验明白”能力的人(即擅长需求分析、系统设计、质量验证和项目管理的人)会变得越来越值钱。工程师的角色可能从亲自编写每一行代码,转向在关键节点指导和监督AI完成工作。

你可能也喜欢

当加密资产成为按揭抵押物:监管、成本与代币化权益的三角难题

Better公司联合Coinbase推出创新按揭方案,允许购房者以比特币或USDC等加密资产作为抵押来获取购房贷款,解决资产充裕但流动资金不足的购房者难题。该方案包含两笔贷款:一笔标准的一级留置权按揭贷款和一笔以加密资产担保、附带房屋二次留置权的私人贷款用于支付首付。其中比特币抵押率要求高达250%,USDC为125%,且无追加保证金机制。 然而,该模式面临监管挑战。七名美国参议员致信联邦住房金融局,以加密资产风险高、融资成本可能增加为由要求叫停此类业务。消费者权益组织也警告其可能引发类似2008年的金融风险。 Better公司CEO Vishal Garg视其为将数字资产接入传统银行体系的重要一步,并计划未来支持更多主流代币化资产(如企业股权代币),甚至探索利用退休账户资产帮助子女购房。长远构想是借助AI简化流程,并实现房产份额化持有与交易。 但代币化权益在法律上的不明确性,特别是持有代币是否等同于拥有底层资产所有权,仍是业务发展的核心争议点。为降低成本,Better正通过代币化融资等方式优化资金渠道,旨在降低客户利率。尽管公司持续亏损且面临质疑,Garg对基于加密资产和代币化的房产金融创新前景仍持坚定态度。

marsbit47分钟前

当加密资产成为按揭抵押物:监管、成本与代币化权益的三角难题

marsbit47分钟前

BlockDAG超级应用九月将至,引爆2100倍回报率讨论,Arbitrum与Optimism表现平平

Layer 2网络本应是推动以太坊下一波增长的引擎,但今年8月,两大主要网络Arbitrum和Optimism的表现似乎陷入停滞。 Arbitrum技术持续获得整合,例如MetaMask集成了基于其Orbit技术栈的Robinhood Chain。然而,其代币ARB价格仍徘徊在0.09美元附近的数月低点,且面临新的代币解锁带来的供应压力。网络发展并未有效提振币价。 Optimism的OP Stack持续获得Kraken等机构的采用,并启动了新一季治理。尽管如此,其代币OP价格仍接近历史最低位,约0.09美元,尽管技术分析显示潜在的双底形态,但反转尚未确认。 与此形成对比的是,BlockDAG为其“超级应用”设定了明确的发布时间:2026年9月。该应用旨在整合挖矿、钱包、质押、交易、娱乐场和支付卡功能,形成一个闭环生态系统。其主网已基于GHOSTDAG共识运行,拥有超过100亿枚BDAG被质押,X1手机应用用户超400万。分析师基于其预售价格与未来回购价格的对比,提出了高达2100倍回报的猜测(此数据仅为推测,并非保证)。 **总结**:尽管Arbitrum和Optimism在技术和生态上取得实际进展,但其代币价格尚未作出反应。BlockDAG则提供了一个不同主张:一个具有明确发布日期、庞大质押量和已铺开全球挖矿业务的“超级应用”。对于寻求短期确定性而非等待市场突破的投资者而言,BlockDAG的明确时间表成为了热议焦点。

TheNewsCrypto1小时前

BlockDAG超级应用九月将至,引爆2100倍回报率讨论,Arbitrum与Optimism表现平平

TheNewsCrypto1小时前

交易

现货

热门文章

从H2A到A2A:AI Agent经济体与Crypto新机遇

6月17日,哈佛大学独立研究员、美国AI科学院(NAAI)通讯院士、比特币基金会终身会员韩锋做客火币HTX《大咖讲堂》第三期,以《从H2A到A2A》为主题,分享了其对Agent经济、Crypto基础设施及数字社会未来发展的思考。

557人学过发布于 2026.07.01更新于 2026.07.01

从H2A到A2A:AI Agent经济体与Crypto新机遇

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.6k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片