刚刚,Claude Fable 5,又拿第一了

marsbit发布于2026-08-04更新于2026-08-04

文章摘要

刚刚,Claude Fable 5在最新的MirrorCode AI编程能力排行榜上,以64%的绝对成功率断层式登顶。排名第二的GPT-5.6 Sol成绩仅为它的三分之一。更引人注目的是,Fable 5在处理Go等热门语言与Ada等冷门语言时,解出率分别为64%和61%,相差仅3个百分点,尽管网络上的Python语料量大约是Ada的230倍。这表明顶尖模型可能已不再依赖对特定语言语料的记忆,而是掌握了从零构建完整软件项目的核心能力。 MirrorCode评测环境严苛,模型需在隔离网络且无法查看源码的情况下,通过反复调用和观察原程序来推理并复现其全部功能。评测要求可见与隐藏测试完成率必须达到100%,并允许模型消耗高达100亿Token、连续运行数天以完成任务。例如,在复现一个约1.6万行的生物信息学工具时,Claude Opus 4.7在14小时内通过了2000项测试(完成度99.95%),而人类工程师完成同等任务估计需2到17周。 当前,AI正从编写单段代码转向承担整个项目级任务。例如,已有数百个AI Agent协作编写超百万行浏览器代码,或搭建能编译Linux内核的C编译器。数据显示,大量用户已开始委托AI完成预计超过数小时甚至数日的开发工作。MirrorCode的64%通过率量化了这种“项目级委托”的可行性:只要目标明确且能自动验收,前沿模型已能独立完成部分中大型软件。 这意味着,未来开发者的角色可能从逐行监工转变为在关键节点进行方向和结果的把控。代码的生产成本将越来越低,而清晰定义问题与准确验收结果的能力将愈发珍贵。

Claude这次,真把AI编程榜单打出断层了!

就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。

紧追其后的GPT-5.6 Sol,分数只有它的三分之一!

排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。

更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。

要知道,在开源世界里,Python语料大约是Ada的230倍。

但到了Fable 5这里,成绩居然只下降3个百分点。

这就有意思了。

如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。

而现在的结果,却指向另一种可能——

最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。

卡死在100%通关线,100亿Token极限测试

具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。

在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。

接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一 点点 写出一个行为一致的新程序。

最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。

并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。

只要漏掉一个边缘案例,整次运行仍然按失败计算。

为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。

论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。

在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。

整个过程,更像一场持续数天的调试,而不是一次生成。

gotree的例子最直观。

这个生物信息学工具原本有大约1.6万行Go代码和40多个命令。

Claude Opus 4.7花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%。

虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几个小时——

Epoch估计,如果不使用AI,人类工程师想要完成同一任务至少需要2到17周。

语料荒漠里,Fable 5只掉了3分

MirrorCode论文曾用StarCoder的公开训练混合作为参照。

其中Python约占8%,Ada只有0.034%,前者大约是后者的230倍。

当然,我们无法知道闭源模型到底见过多少Ada代码。但拿公开生态作参照,Ada有多稀缺已经足够直观。

这门语言主要出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。

而Fable 5显然不是在把Go代码逐句翻译成Ada。

它更像是先摸清原程序究竟怎么工作,再换一门语言,把同样的行为重新造出来。

相比之下,其他模型就没这么稳了。

GPT-5.6 Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5更是从17%掉到5%。语言一换,差距立刻被放大。

把整个项目交给AI

如今,Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码。

Anthropic则让16个Claude Agent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux 6.9内核的C编译器。

OpenAI披露的截至5月Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务;25.6%提交过超过八小时的任务。

人们交给AI的单位,正在从一段代码、一个bug,变成一个下午、一周,甚至整个项目。

MirrorCode的64%,正是对这种「项目级委托」的一次量化。

它说明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立做完一部分中大型软件。

对每一个正在把工作交给AI的人来说,变化已经近在眼前——

以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。

代码会越来越便宜。

而那些能把问题说清楚、把结果验明白的人,会越来越值钱。

参考资料:https://epoch.ai/MirrorCode

本文来自微信公众号“新智元”,作者:ASI启示录;编辑:摩西

热门币种推荐

相关问答

Q在最新的MirrorCode排行榜上,Claude Fable 5的成功率是多少?紧追其后的GPT-5.6 Sol分数又是多少?

A在最新的MirrorCode排行榜上,Claude Fable 5的成功率是64%。紧追其后的GPT-5.6 Sol分数只有它的三分之一,即大约21.33%。

Q文章中提到,在使用Go和Ada语言时,Claude Fable 5的解出率分别是多少?这说明了模型的什么能力?

A在使用Go语言时,Claude Fable 5的解出率是64%;换成冷门语言Ada后,成绩仍然高达61%。这说明Fable 5可能已经超越了单纯记忆和模仿热门语言代码的模式,具备了从零构建完整软件项目、深刻理解程序逻辑并跨语言实现相同行为的能力。

QMirrorCode基准测试对模型通关的要求是什么?它如何确保测试的严格性?

AMirrorCode基准测试要求模型必须达到100%的可见测试与隐藏测试完成率才算通过,即使完成99.9%也会被判定为失败。它通过将模型置于隔离环境(无网络、无法查看源码和第三方依赖)、提供高层文档和部分测试、允许调用原程序进行反向工程,并设置了极高的单次计算预算(高达100亿Token和最长连续运行7天甚至19天)来确保测试的极端严格性。

Q文章中提到Claude Opus 4.7在复现‘gotree’工具时取得了什么成绩?这个成绩的意义是什么?

AClaude Opus 4.7在复现大约1.6万行Go代码的‘gotree’生物信息学工具时,花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%,仅因漏掉一个处理日期注释的边界案例而未能达到100%通关线。这个成绩的意义在于,它将原本需要人类工程师2到17周的工作量压缩到了十几个小时,展现了AI在复杂软件工程任务上巨大的效率潜力。

Q根据文章,当前AI编程能力的发展,正在导致软件行业中什么趋势的变化?

A根据文章,当前AI编程能力的快速发展(如能独立完成中大型软件项目),正在导致软件行业的趋势发生变化:代码的生产成本将变得越来越便宜。与此同时,那些具备“能把问题说清楚、把结果验明白”能力的人(即擅长需求分析、系统设计、质量验证和项目管理的人)会变得越来越值钱。工程师的角色可能从亲自编写每一行代码,转向在关键节点指导和监督AI完成工作。

你可能也喜欢

前FBI主管承认盗取价值100万美元的加密货币

前FBI监管探员帕特里克·史蒂文·亚罗奇被指控利用内部系统获取与某敌对国家关联的加密货币钱包凭证,并将资金转入自己的加密钱包。 根据一份周六的美国联邦法院文件,亚罗奇承认在2024年末至2025年初进行了10次未经授权的转账,涉及数字资产总额估计约100万美元,其中部分资金被他存入Suilend以赚取收益。 在自我报告事件后,亚罗奇于上周三被行政停职、解雇,并于周五被捕。探员从其弗吉尼亚住所查获了设备、助记词和一个Trezor硬件钱包,用以访问其在Suilend和加密货币交易所Kraken的账户。在他的配合下,约92.5万美元资金被转移至政府控制的钱包。 今年五月,亚罗奇曾使用ChatGPT寻求建议。根据法庭文件,他在AI提示中写道:“如果我有一百万美元,你会建议如何投资/花费以最大化利润和回报?”ChatGPT建议“在奇伦托或葡萄牙的杜奥等地区建立一种慢生活的葡萄园/农业生活方式”。 亚罗奇是涉及联邦探员的最新一宗加密货币盗窃案。2015年,前DEA特工卡尔·M·福尔斯在认罪前转移了约70万美元的比特币,后被判处六年半监禁。同年,前美国特勤局特工肖恩·W·布里奇斯盗窃了约35万美元的BTC,认罪后被判处六年监禁。这两起案件均与暗网市场“丝绸之路”的调查有关。

cointelegraph8分钟前

前FBI主管承认盗取价值100万美元的加密货币

cointelegraph8分钟前

比特币将延续横盘趋势?重磅玩家指向九月下旬!详情在此

加密货币衍生品市场出现一笔大额交易,引起关注。据区块链和衍生品市场分析师ai_9684xtpa提供的数据,一位大型期权投资者卖出了总价值1.73亿美元的比特币看涨期权,其头寸表明他认为BTC价格在9月25日之前不会突破70,000美元。 这笔交易意味着该投资者并不预期比特币短期内会大幅上涨。卖出看涨期权时,卖方获得权利金,如果到期时比特币价格低于行权价,卖方将获利。具体而言,若BTC在期权到期时未超过70,000美元,该投资者预计将获得约303万美元的权利金收益;反之,若价格高于该水平,则可能面临亏损。因此,这笔交易被视为反映价格将维持在一定水平以下的重要策略。 期权市场受到密切关注,因其反映了专业投资者对未来价格的预期。此类数百万美元的大额交易,尤其能提供关于机构投资者风险认知和价格预期的重要信息。不过,分析人士强调,这笔交易本身并不一定意味着比特币价格会下跌,因为期权交易者常使用复杂的策略来平衡不同头寸的风险,单笔交易不足以预测市场方向。 然而,选择70,000美元这一水平表明,投资者认为该区域是一个重要的技术阻力位。未来几周,美国的宏观经济数据、央行货币政策预期以及现货比特币ETF的资金流入情况,预计将成为决定BTC价格的关键因素。 *本文不构成投资建议。

cryptonews.ru32分钟前

比特币将延续横盘趋势?重磅玩家指向九月下旬!详情在此

cryptonews.ru32分钟前

交易

现货

热门文章

从H2A到A2A:AI Agent经济体与Crypto新机遇

6月17日,哈佛大学独立研究员、美国AI科学院(NAAI)通讯院士、比特币基金会终身会员韩锋做客火币HTX《大咖讲堂》第三期,以《从H2A到A2A》为主题,分享了其对Agent经济、Crypto基础设施及数字社会未来发展的思考。

557人学过发布于 2026.07.01更新于 2026.07.01

从H2A到A2A:AI Agent经济体与Crypto新机遇

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.6k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片