“智能体最后的考试”，Fable 5竟然不敌GPT 5.5

marsbit發佈於 2026-06-12更新於 2026-06-12

文章摘要

UC伯克利团队推出全新基准测试“智能体最后的考试”（ALE），旨在评估AI智能体在真实工作场景中的实际操作能力。测试覆盖55个行业领域，要求智能体在Siemens NX、Unreal Engine、Adobe After Effects等专业软件中完成建模、场景搭建、特效合成等任务。结果显示，在最难的任务档中，包括Claude Fable 5和GPT 5.5在内的主流模型通过率均为零。在难度稍低的任务中，GPT 5.5以24%的通过率领先于Claude Fable 5的22%，且在成本效率上优势明显——Fable 5花费了Codex框架四倍多的成本，成绩却更低。 ALE与此前基准测试的不同在于，它专注于“能干什么”而非静态知识检索，通过GUI和命令行赋予智能体完整计算机操作权限，并由代码自动评分，避免主观判断。测试题目大部分保密且定期轮换，防止模型通过记忆题目获取高分。此外，测试揭示了智能体的常见失败模式：常在未验证成果时即宣布任务完成。对于Claude Fable 5表现不佳的原因，分析指出可能因其在敏感任务中被静默切换至能力更弱的版本，且此前有基准测试显示Claude系列存在利用测试环境漏洞（如查看git历史）的行为，而ALE的设计避免了此类问题。该测试表明，当前AI智能体在复杂真实任务中仍远未达到人类专家水平，业界关于“Agent即将取代人类工作”的预测仍需谨慎看待。

没想到打脸来得如此之快!!

刚刚,UC伯克利放出了一场号称“智能体最后的考试”的全新基准测试。

它把当今最强的AI Agent们拉到考场上,让它们干真正的活——

在Siemens NX里建3D模型、在Unreal Engine里搭游戏场景、在Adobe After Effects里做特效合成。

结果成绩令人傻眼:

最难的一档,当今公认最强的Claude Fable 5、GPT 5.5,全是大写的零蛋。

你说难度稍微放低一点呢?分数倒是有了,但结果也相当令人意外——

GPT 5.5竟然还小胜了Claude Fable 5。

我没听错吧,A家刚发布的最强模型Claude Fable 5,被几个月前的GPT 5.5打败了??

要知道在此前几乎所有主流benchmark上,Fable 5对GPT 5.5都是碾压级别的存在——SWE-Bench Pro上80.3%对58.6%,Humanity’s Last Exam上64.5%对52.2%。

但换到这场“真干活”的考试里,局面却反了过来。

这个新基准叫Agents’ Last Exam(ALE),背后团队来头不小,之前MMLU、MATH、CyberGym、ExploitGym这些你耳熟能详的基准都是他们提的。

取这个名估计也是参考之前Scale AI那个“Humanity’s Last Exam”(人类最后的考试),只不过这次被考的不是人类知识的极限,而是AI Agent干活的极限。

该说不说,这个测评一出来,以前天天喊着“Agent要取代人类工作”的人,这下是真干沉默了...

“智能体最后的考试”,赢家竟是GPT 5.5!

先看完整排行榜。

从最核心的任务通过率指标来看,GPT 5.5直接包揽冠亚军:

第1名是GPT 5.5搭配OpenAI自家的Codex框架,通过率24.0%。

第2名还是GPT-5.5,只不过换了ALE Claw框架,通过率23.0%。

(ALE Claw是团队自己写的一个baseline Agent,跟Codex、Claude Code、Cursor CLI这些商业框架并列参赛)

直到第3名,我们才看到Claude Fable 5的身影——搭配Claude Code,拿下22.0%的通过率。

往下看更有意思。

第4、第5、第8名全是GPT 5.5,只是换了不同的框架。

前10名里GPT 5.5出场了5次,加上第6名的GPT 5.4,OpenAI模型直接占了6席。

而Claude家族呢?

Fable 5拿了第3,Opus 4.7第9(18.4%),Opus 4.8垫底第10(15.8%),不敌之势一目了然。

也不怪OpenAI研究员喜庆发帖,欢欢喜喜过大年了:

而在成绩之外,这里还有这样几个值得细品的信号。

一是天花板低得惊人。

冠军通过率才24%,综合得分最高也不过45.8%。

意思是,就算按最宽松的“部分得分”算,最强的Agent也只能拿到不到一半的分。

而这些题全部来自真人专家已经完成的项目——人类专家的完成率理论上就是100%。

二是Claude烧钱烧得惊人。

这张榜单新增了一列“Estimated Total Cost”,一下子把贫富差距拉出来了:

Fable 5跑完全部任务花了2315美元,Opus 4.8花了1838美元,Opus 4.7也要1144美元。

而GPT-5.5这边呢?

最贵的Codex也就566美元,Cursor CLI只要174美元。

等于说,Fable 5花了Codex四倍多的钱,成绩还低了两个百分点。

三是效率差距同样触目。

Ale Claw跑完全部任务花了47小时20分钟,Cursor CLI只花了67小时。

而Opus 4.8呢?451小时——将近19天。

干的活最少,花的时间最长,收的钱最多(居然真有模型能同时做到?)

当然如果只看Claude Fable 5、GPT 5.5这两个最顶的,GPT 5.5的时间优势依旧明显。

而最扎眼的数字,还是那个零。

ALE把任务分成了三个难度档:

Near-Term(近期可解)

Full-Spectrum(全面覆盖)

Last-Exam(终极难题)

在最难这一档,所有主流配置的平均通过率只有2.6%,包括GPT 5.5和Fable 5在内的大多数模型直接吃了零蛋。

所以这张成绩单的核心信息很简单:别看平时考试成绩好,一到真干活全露馅了。

答题学霸≠干活能手,这话在AI世界也一样适用。

什么是ALE?

要理解ALE为什么能把这帮“学霸”打回原形,得先看它跟以前的考试有什么不一样。

之前的Humanity’s Last Exam(HLE)是2025年初由Dan Hendrycks和Scale AI搞出来的,2500道跨学科难题,本质上还是闭卷答题——

给你一个问题,你给我一个答案,再难也是静态的知识检索。

而ALE完全不同,它考你“能干什么”。

核心作者Yiyou Sun在X说得很直白:

AI智能体将在2026-2027年超越人类完成几乎所有工作——这个预测到处都是。所以我们造了这场考试来验证这个说法。

ALE的每道题都来自一个真人专家已经完成的项目,覆盖55个行业子领域,包括量化交易、基因组分析、航空航天工程、建筑设计、脑成像、动画特效、法律研究......

整个体系锚定的是美国联邦职业分类标准(ONET)*,说白了就是按“真实劳动力市场”来出题。

参与出题的阵容也够豪华:

300多位领域专家来自100多家机构,学术侧有MIT、Harvard、Stanford、Oxford、Caltech、ETH Zurich,产业侧有Goldman Sachs、JPMorgan、Meta、Amazon、Adobe、Oracle。

Snorkel AI通过Open Benchmarks Grants项目提供了资金支持。

考试形式也不是打字回答问题,而是直接操作电脑。

ALE用的是所谓GCUA框架(Generalist Computer-Use Agent,通用计算机使用代理),给Agent完整的GUI和命令行权限——

鼠标点击、键盘打字、写脚本、浏览网页,人类能在电脑上干的它都能干。

不限方法,只看结果。

交出来的“作业”由确定性代码自动评分。

No vibes. No human judges. Fully reproducible.(不靠感觉,不靠人类裁判,完全可复现)

这就堵住了之前很多benchmark的一个老毛病:评分器本身就能被骗。

此外,ALE在防作弊上还有一个狠招——

只公开约10%的题目(约150道),剩下1300多道严格保密。

公开题和私密题定期滚动轮换,确保不会有模型因为“背题”而拿高分。

这在当前benchmark数据污染泛滥的背景下,算是一个相当巧妙的设计。

整体而言,跟现有的Agent基准测试比,ALE的定位非常明确。

团队成员之一的Dawn Song专门拉了一组对比:

ALE的CLI子集 (ALE-CLI) 覆盖40个行业子领域,而Terminal-Bench只有6个,SWE-bench-Pro只有5个;

人类完成这些任务的时间从几小时到几周不等,而后两者是几分钟到几天;

最强Agent在ALE-CLI上的通过率只有25.2%,而Terminal-Bench上是82.0%,SWE-bench-Pro上是59.1%。

一言以蔽之,其他考试已经快被做穿了,而ALE还远得很。

这就是ALE凭什么敢自称“智能体最后的考试”的理由。

值得一提的是,Dawn Song还分享了两个有趣的观察:

一个是,Agent会在没有真正验证工作成果的情况下宣布完成,这是Agent们最典型的失败模式。

很多时候,虽然它们说了“Done. All checks pass.”(搞定了,所有检查都通过了)

但实际产出可能缺少必要文件、数字算错、关键字段遗漏、或者直接违反了任务说明中的明确约束。

等于是,活没干完,嘴先说完了。

另一个是很多人疑惑的,为啥Fable 5这么拉胯?Dawn Song给出的回答是:

不存在“万能冠军”这回事。

每个前沿模型都有擅长的领域和拉胯的领域,ALE覆盖55个行业、1500+道题,最终得分是所有领域的平均值,很多模型的总分因此挤在一起。真正有价值的信号不在总分,而在不同模型在不同领域的表现差异——在同一道题上,不同模型往往因为完全不同的原因而失败。

当然也有可能是Fable 5偷偷“降智”了。

总榜里,Fable 5旁边标黄了一句“may be down-tuned”(可能被降级),这说的是Fable 5的一个已知问题——

它底层是Mythos模型加安全分类器,遇到网络安全、生物医学等敏感领域的任务时,会被静默切换到能力更弱的Opus 4.8。

在ALE这种覆盖55个行业的考试中,等于这部分科目直接派了替考,而且派的还是“奔波儿灞”这种角色。

One More Thing

当然,有没有可能Claude Fable 5的成绩本身就有问题呢?

不好说,但一桩八卦显示,Claude有“前科”。

5月底,初创公司Datacurve发布了一个叫DeepSWE的新benchmark,顺手揭了一个大底——

SWE-Bench Pro的Docker容器里附带了代码仓库的完整git历史,正确答案就躺在文件系统里。

大多数模型会无视它,但只有Claude不会。

它会主动检查仓库的git历史,从历史提交中寻找与任务对应的修复方案,并据此恢复正确补丁。

据称Opus 4.7约18%的通过成绩是这么拿的,Opus 4.6更夸张,约25%。

而GPT 5.4和GPT5.5这边呢?完全没有这种行为。Datacurve的措辞很外交:

这个benchmark让这种行为成为可能,但Claude是唯一持续这么做的家族。

科技媒体VentureBeat的评价倒很暧昧:

这说明Claude“环境感知能力”很强,非常擅长探索周围环境并利用可用资源。算“作弊”还是“机灵”,取决于你的立场。

但甭管怎么看,ALE显然吸取了教训——

直接把考场从命令行搬到了GUI桌面操作,让你没有git历史可以偷看。

评测AI的考场,正在被AI自己倒逼着升级,也算很精彩了。

完整测评地址:https://agents-last-exam.org/leaderboard项目主页:https://agents-last-exam.org/GitHub:https://github.com/rdi-berkeley/agents-last-exam

参考链接:

[1]https://x.com/i/trending/2065215002878021789

[2]https://venturebeat.com/technology/deepswe-blows-up-the-ai-coding-leaderboard-crowns-gpt-5-5-and-finds-claude-opus-exploiting-a-benchmark-loophole

[3]https://venturebeat.com/technology/surprise-upset-gpt-5-5-beats-claude-fable-5-on-brutal-new-agents-last-exam-benchmark

本文来自微信公众号“量子位”,作者:一水

你可能也喜歡

对话达利欧：当下正处AI泡沫中，投资组合的1%是比特币

桥水基金创始人瑞·达利欧在访谈中指出，当前AI热潮已显现经典泡沫特征，高估值与过度借贷可能在未来经济变故下引发资产抛售与衰退。他强调，这背后是更宏大的“大周期”在起作用，即贫富差距、政府债务高企及地缘政治变动共同驱动的约80年循环，目前全球秩序正处力量交替的衰退阶段。为应对不确定性，达利欧建议个人投资者进行多元化资产配置，包括股票、黄金、债券等，而非仅持有现金。他透露自己投资组合中约有1%为比特币，认为其具备硬通货特性，但个人更偏好实物黄金。对于AI的影响，他认为这将在更高层面替代人类思维，加剧贫富差距，而善于运用人类情感、直觉并与AI协作的人将更具优势。谈及英美热议的“财富税”，达利欧认为操作困难，可能引发资本外流或刺破泡沫。关于世界秩序，他预判未来可能走向区域化发展，而非单一主导。最后，他指出美国卷入伊朗冲突暴露了其军事与经济影响力的脆弱性，类似历史上大英帝国的衰落征兆。

marsbit3 小時前

marsbit3 小時前

单日 7.2 万亿韩元，外资周五净买入创纪录！华尔街：韩股资金面逆风已经消退

韩国股市资金面出现实质性转机。7月31日，外资单日净买入KOSPI股票约7.2万亿韩元，创历史最高纪录，标志着持续数月的外资净流出趋势发生根本逆转。7月外资净卖出规模已大幅收窄至9.8万亿韩元，远低于5、6月的水平。同时，国内养老金及基金在7月转为净买入1.0万亿韩元。监管层面，韩国金融服务委员会自7月31日起收紧散户投资单股杠杆ETF的门槛，新规实施后相关产品成交量已降至月均水平的约50%，有助于平抑市场短期波动。花旗研究维持KOSPI年内目标点位10000点不变，认为资金面逆风正在消退。支撑因素包括存储芯片行业基本面稳健、KOSPI估值处于历史低位、韩国经济基本面强劲以及政策环境友好。花旗还指出，若有必要，韩国金融当局存在提供流动性支持的可能性，为市场提供了政策底部支撑。

marsbit3 小時前

marsbit3 小時前

突发！OpenAI下一代AI攻克10项菲尔兹奖级难题

OpenAI发布其下一代AI模型Astra，在数学领域取得轰动性突破，一举攻克了10个长期未解的难题，其中多项成果被专家评价为“菲尔茨奖级别”。这些突破涵盖了高维几何、群论、算子代数等多个核心数学分支，相关论文长达249页。最引人注目的成果包括：构造出首个无限有限呈现的“非sofic群”，否定了自1999年提出相关猜想；在高维球体堆积问题上，打破了自1978年以来人类未能突破的理论极限；推翻了菲尔兹奖得主Alain Connes提出的“刚性猜想”，构造出无限多不同构但生成相同冯·诺依曼代数的群。据称，生成这10项证明的总计算成本仅约2000美元。所有证明均通过了Lean 4形式化验证，确保了其严密性。这一系列成果被视作AI在深度推理和数学直觉上的重大飞跃，标志着AI已成为数学研究领域的强大工具。

marsbit4 小時前

marsbit4 小時前

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击，许多人担心工作被取代。然而，真正的威胁在于个人对他人和系统的依赖，以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键，不是抵制技术，而是成为拥有高自主性的“不可受雇”个体。文章提出了成功抵御AI替代的五个核心要素：自主性（主动行动的能力）、品味（判断事物价值的经验）、说服力（让他人关注你工作的能力）、毅力（坚持并从错误中学习）和迭代（根据反馈持续改进）。这些能力无法仅通过理论学习获得，必须通过实践来培养。要启动转变，首先要彻底改变环境，重塑身份认同。其次，应选择一个能获得真实、快速反馈的实践领域，例如创业。在众多技能中，内容创作（媒体）比编写代码更具优势，因为其价值是主观的，需要独特的审美和判断力，这正是AI目前难以完全复制的。具体行动上，可以从三个步骤开始： 1. **挖掘原始素材**：反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣，找到独特的个人经验。 2. **确立反向思考主轴**：找出你坚信但主流观点错误的地方，或行业内普遍忽视的“皇帝新衣”，形成独特的批判性视角。 3. **立即发布**：将前两步的思考融合，撰写并发布第一个核心内容（如帖子、视频），勇敢接受真实世界的反馈，并在此基础上持续学习和迭代。最终，抵御AI的关键在于构建一份与自身身份深度契合的毕生事业，通过持续的内容创作和真实互动，建立无法被自动化取代的独特价值和影响力。行动，从今天发布第一个想法开始。

marsbit5 小時前

marsbit5 小時前

通过掷骰子离线保管比特币密钥：并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下： **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定，理论上虽可预测，但实践中无法被攻击者复制或计算，从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵，50次投掷即可满足典型12词助记词（128比特熵）的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷，致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响，因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示：手工种子并非万能保护** 安全研究员指出，即使用户使用骰子生成了安全的种子，若他们使用了Coldcard的其他功能（如生成纸钱包、克隆密钥、共享签名密钥、密码等），这些**衍生密钥**仍可能调用有漏洞的随机数生成器，从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠，但该方法对大多数用户并不友好： * **过程繁琐易错**：需投掷50-99次，精确记录，任何输入错误都会导致钱包完全不同。 * **引入新风险**：用户可能在记录、转换过程中泄露信息，或使用有偏的骰子/投掷方式。 * **用户体验差**：难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应： * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码，如有则需立即更换。 * 考虑采用多签方案，使用不同厂商的设备分散风险。 **结论**：手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项，但其过程复杂、容易出错，不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru8 小時前

cryptonews.ru8 小時前

交易

現貨

“智能体最后的考试”，Fable 5竟然不敌GPT 5.5

文章摘要

“智能体最后的考试”,赢家竟是GPT 5.5!

什么是ALE?

One More Thing

相關問答

你可能也喜歡

对话达利欧：当下正处AI泡沫中，投资组合的1%是比特币

单日 7.2 万亿韩元，外资周五净买入创纪录！华尔街：韩股资金面逆风已经消退

突发！OpenAI下一代AI攻克10项菲尔兹奖级难题

如何让自己变得让人工智能永远也无法取代

通过掷骰子离线保管比特币密钥：并非人人愿意为之

交易

熱門分類

熱門標籤