大模型刷爆所有考试,却离AGI更远了:这篇论文拆穿了什么?

marsbit发布于2026-05-28更新于2026-05-28

文章摘要

大模型在各种考试中表现优异,却被一篇新论文指出离真正的通用人工智能(AGI)更远了。目前业界对AGI缺乏公认定义,导致目标模糊。学者Michael Timothy Bennett提出新观点,认为真正的AGI不应以模仿人类为标准,而应是在有限计算、记忆和能量资源下,能像“人工科学家”一样广泛、高效、科学地适应新环境和发现新知识的系统。 他指出当前大模型本质是“规模最大化近似”,依赖海量数据记忆答案,缺乏真正的因果理解和主动探索能力。例如,模型可能因文本概率而错误比较“9.11和9.9”。真正的AGI需具备三大关键能力:从被动响应变为主动实验者;从学习相关性到理解因果关系;在资源限制下动态平衡“探索新知”与“利用已知”。 论文将构建智能的元方法分为三类:主流的规模最大化、追求简洁的简单性最大化,以及弱化约束让系统自寻最优解的约束弱化最大化。Bennett认为,单靠堆参数的路线无法实现AGI,未来需要多种方法融合。 若“人工科学家”标准被接受,AI发展将迎来范式转移:评估重点将从刷榜考试分数,转向测试其在未知环境中的适应与发现能力;技术路线也将从单纯追求规模,转向融合因果推理、主动学习等多维能力的发展。这提示AGI的实现并非现有技术的线性延伸,而是一次根本性的路线重置。

如果有人告诉你,AGI(通用人工智能)已经实现了,你怎么判断他是在说真话,还是在吹牛?

在OpenAI与微软曝光的秘密协议里,这把尺子是财务报表——开发出能产生至少1000亿美元利润的AI系统就算AGI。而在黄仁勋嘴里,这把尺子是时间——五年内必现;马斯克更是屡次放出“明年达成”的预言。

行业大佬们各说各话,根源不在于谁在说谎,而在于AGI这个概念本身,根本就没有一把公认的尺子。正如AGI研究领域中一位有独立思考的研究者Bennett在论文中所说,AGI已被炒作和猜测还原成了“罗夏墨迹测试”——每个人看到的只是自己心里的想象,而非客观事实;而圣塔菲研究所科学家Melanie Mitchell也认为,这场辩论只能通过长期的科学研究来厘清。(附论文地址:https://arxiv.org/pdf/2503.23923)

这是AI行业当下最荒诞的困境:我们正在全速狂奔,去追逐一个连终点线都没画清楚的目标。

2025,谁在重画AGI的起跑线?

面对这种定义真空,学术界在2025年开始密集“补位”。Bengio等学者强调“多功能性”和“熟练度”;DeepMind提出“分布式AGI”,试图打破单体全能的迷思。

但澳大利亚国立大学的研究员Michael Timothy Bennett,在3月底提交到arXiv的一篇论文中,给出了一个极具挑衅性却也最切中肯綮的答案。

他指出,前人的定义绕来绕去,依然在跟“受过教育的成年人”较劲。Bennett采纳了学者Pei Wang对智能的定义——将智能视为有限资源下的适应能力——从根本上跳出了“像人”的框架,并将AGI定义为一种“人工科学家”。

他提出,真正的AGI应当是一个能在计算、记忆和能量等现实约束下,像人类科学家一样广泛、高效且科学地适应新环境和任务的系统。

这句话的潜台词是:评判AGI的标准,不该是它模仿人类有多像,而是它“发现新知”的能力有多强。

为什么急需一把新尺子?因为旧尺子——图灵测试和人类基准测试——已经被大模型刷爆了,但我们却离真正的通用智能越来越远。

2025年,如果你问一个顶尖大模型“9.11和9.9哪个大”,它依然可能信誓旦旦地告诉你9.11大,因为11大于9。在解决复杂的数学不等式证明时,大模型即便蒙对了答案,推理过程也往往是逻辑崩溃的。

Bennett一针见血地指出了病因:当前的大模型走的是“规模最大化的近似”路线——用海量数据和算力,把各种任务的近似答案提前存在网络权重里。一旦遇到没见过的分布外问题,就立刻露馅。

更致命的是,大模型没有“主动能力”。它无法主动做实验验证猜想,无法自主构建因果链条,更无法在“继续探索”与“利用已知”之间做权衡。

回到9.11和9.9的比较——大模型不是不会算术,而是它根本没有建立关于数字比较的因果模型。它只是在用概率去猜那个它见过的、最接近的文本片段。

“模仿能力”与“适应能力”之间的鸿沟,正是新AGI标准想要测量的核心。

智能的新刻度:拆解“人工科学家”

Bennett的这套标准之所以值得重视,是因为他把AGI从一个模糊的哲学命题,降维成了可量化的工程问题。

在他看来,一个真正的AGI,其行为模式应该完美对齐人类科学家的研究范式:

第一,从“提线木偶”到“主动实验者”。

今天的AI是彻头彻尾的被动学习者,只能“看”人类喂给它的数据。但科学家不是,如果一个科学家被锁在一个陌生房间里,他绝不会站在原地等信息,而是会去推门、拉把手、检查窗户——这就是“主动实验”。真正的AGI,必须能自主规划实验,通过主动交互获取关键信息。

第二,从“知其然”到“知其所以然”。

这是当前AI最大的短板。大模型是极端的“相关性学习器”,它知道“下雨”常伴随“地湿”,但不知道是谁导致了谁。只有理解了因果,才懂得在晴空万里但地面湿润时,推断出是洒水车经过而非即将下雨。没有因果理解,AI永远只能在训练数据的分布内打转,这与“通用”毫不相干。

第三,在“探索”与“利用”之间走钢丝。

如果只探索不利用,掌握再多知识也解决不了眼前问题;如果只利用不探索,环境一变就束手无策。AGI必须在资源受限下动态平衡这对矛盾——知道自己不知道什么,并据此分配算力。

此外,Bennett还加入了一个极具现实感的维度:能量限制。把“能量”写进定义,意味着他划清了一条底线:真正的智能不是拥有无限资源,而是在有限资源下优雅地适应。需要消耗一座核电站才能解决新问题的AI,只是昂贵的计算器,不是AGI。

通向AGI的路线重置:告别单一Scaling Law

基于上述框架,Bennett把当前构建智能系统的元方法拆解为三类:

Scale-maxing(规模最大化):当前主流的大模型路线,拼命堆参数、数据和算力。但瓶颈已经显现:样本和能量效率极低。

Simp-maxing(简单性最大化):追求模型结构的极致简洁,信奉奥卡姆剃刀。但简单性是形式的属性而非功能的属性——不同图灵机下的“最简”可能完全不同,使其难以摆脱主观性陷阱。

W-maxing(约束弱化最大化):尽可能弱化功能约束,让系统自行寻找最优解。实验表明,仅W-maxing就能在特定任务上实现110%-500%的泛化率提升,但它需要搜索无限的硬件形态空间,优化难度极高。

Bennett的结论极其清晰:尽管Scale-maxing目前占据绝对主导,但AGI绝不是靠单一路线的暴力美学能达成的,它必然是多种元方法的融合。

如果“人工科学家”的定义被广泛接受,AI行业将迎来一次深层的范式转移。

评判标准将彻底改变。我们不再需要看大模型在人类考试排行榜上又超了多少分,而是建立一套“适应性基准”:把AI扔进一个从未见过的物理环境,看它能否在有限交互内发现规律;给它一个新游戏,看它能否比人类更快理解规则;甚至让它去解决真实的科学问题,看它能否自主提出假说并设计实验验证。核心不再是“你知道多少”,而是“你能发现多少”。

技术路线也将随之转向。单纯的Scaling Law很快会触顶,因为被动接收的数据喂不出因果性。搜索与近似、规模最大化与约束弱化——AGI的达成必然是多种工具和元方法的融合,而非单一路线的延伸。

Bennett的论文之所以重要,不是因为他给出了AGI的终极答案,而是他把这面名为“智能”的模糊镜子擦干净了一角。他让我们看到,AGI的实现不是大模型的线性迭代,而是一次路线重置。

AGI到底该是什么样?答案不在那些越来越像人的对话,而在那些能够主动追问“为什么”、并亲手去验证答案的能力中。当AI真正走出“罗夏墨迹测试”的迷雾,它将不再只是模仿人类的样子,而是拥有科学家的精神。(本文首发钛媒体APP,作者 | 硅谷tech news,编辑 | 赵虹宇)

相关问答

Q文章认为当前衡量AGI的标准存在什么问题?

A文章认为当前AGI(通用人工智能)缺乏公认的、清晰的衡量标准,变成了“罗夏墨迹测试”,每个人看到的都是自己心中的想象,而非客观事实。旧有的测试(如图灵测试和人类基准测试)已被大模型通过,但这并不代表真正通用智能的实现。

Q论文作者Michael Timothy Bennett提出了怎样的AGI新定义或标准?

A论文作者Michael Timothy Bennett将AGI定义为一种“人工科学家”。即一个能在计算、记忆和能量等现实约束下,像人类科学家一样,能够广泛、高效且科学地适应新环境和任务的系统。评判标准从“模仿人类有多像”转向“发现新知的能力有多强”。

Q根据文章,当前主流的大模型(Scale-maxing路线)在实现AGI方面有哪些根本性缺陷?

A当前主流大模型(Scale-maxing路线)的根本性缺陷在于:1. 本质上是“规模最大化的近似”,靠海量数据提前存储答案,遇到未见过的分布外问题就会失效。2. 缺乏“主动能力”,无法主动实验、自主构建因果链、在探索与利用间做权衡。3. 是极端的“相关性学习器”,缺乏因果理解能力,无法“知其所以然”。

Q文章提到的“人工科学家”应具备哪三种核心行为模式或能力?

A文章提出的“人工科学家”应具备以下三种核心行为模式或能力:1. 从“提线木偶”到“主动实验者”:能自主规划并执行实验,通过主动交互获取关键信息。2. 从“知其然”到“知其所以然”:具备因果理解能力,而非仅依赖相关性。3. 在“探索”与“利用”之间走钢丝:能在资源受限下动态平衡对新知识的探索和对已知知识的利用。

Q如果“人工科学家”的定义被广泛接受,将对AI行业带来哪些改变?

A如果“人工科学家”的定义被广泛接受,将对AI行业带来两大核心改变:1. 评判标准彻底改变:不再依赖通过人类考试排行榜,而是建立一套“适应性基准”,测试AI在从未见过的环境或任务中发现规律、解决真实问题的能力。2. 技术路线转向:单一的Scaling Law(规模缩放法则)路线将触顶,实现AGI需要融合规模最大化、简单性最大化、约束弱化最大化等多种元方法。

你可能也喜欢

Circle 将 Zama 协议地址列入黑名单,冻结价值 1260 万美元的用户资金 - 详情

稳定币发行商Circle已将一个与隐私协议Zama相关的智能合约列入黑名单,冻结了约1260万美元的用户资金。此次冻结首先由链上调查员ZachXBT发现,涉及Zama在以太坊上部署的保密USDC(cUSDC)合约。该合约地址在Zama的公开文档中可查,其冻结过程可被实时追踪和验证。 进一步分析显示,此次冻结可能与资产管理和收益协议Overnight Finance近期的争议及法律问题间接相关。数据显示,一个疑似与Overnight Finance相关的钱包于2026年5月11日向Zama合约存入约1240万美元USDC。Overnight Finance近期正面临治理纠纷和可能被团队“拉地毯”的指控,并因此进行了国库资产分配投票。此外,该公司还卷入一起民事诉讼,原告之一是DeFi领域以激进治理策略闻名的Patagon Management。尽管Circle的行动与这些事件之间尚无直接因果证据,但法律程序、资金流动与冻结事件的重叠,引发了人们对DeFi协议间风险传导的担忧。 Circle此次单方面行动再次引发对中心化发行商透明度的批评。据ZachXBT称,Zama团队在合约被列入黑名单前似乎未获任何通知。这加剧了人们对中心化实体在无预警情况下影响去中心化应用及其用户的担忧。此前在2026年3月,Circle曾冻结多个实体相关的热钱包而未公开说明理由。本次行动则更进一步,直接冻结了协议级别的资金池合约,而非独立钱包,这引发了人们对所谓去中心化系统中托管风险的质疑。截至目前,Circle尚未就冻结Zama合约的原因发布官方解释。

bitcoinist21分钟前

Circle 将 Zama 协议地址列入黑名单,冻结价值 1260 万美元的用户资金 - 详情

bitcoinist21分钟前

三年之后:回看 2023 年我对 ChatGPT 的判断

作者王健硕在2026年5月回看其于2023年3月对ChatGPT做出的二十条预测,并借助AI代理进行验证。整体看,其大方向判断多正确,但细节和程度常有偏差。 **看对的方面:** - **技术架构**:准确预测RAG(检索增强生成)将成为解决知识更新和幻觉的主流方法,以及LUI(自然语言用户界面)将催生巨大新产业。 - **发展趋势**:预见到“机器人网络”和新的agent寻址系统将出现,中国能快速做出可用大模型并缩小与顶尖差距。 - **本质认知**:正确指出ChatGPT没有意识,图灵测试仅测表象;判断其是巨大进步但非AGI,且短期内不会造成整体失业潮。 **看错或看偏的方面:** - **具体数据错误**:关于GPT-4有100T参数的传闻完全错误。 - **绝对化判断**:断言LLM“不可能”自己学好数学被后来模型在IMO夺金证伪;认为AI生成内容可“规避”版权,实则引发史上最大侵权赔偿。 - **价值与成本误判**:认为价值终落应用层,但最大赢家是算力层(如英伟达);模型成本“5-10亿封顶”的估算严重偏离实际。 - **社会影响误读**:认为ChatGPT的“加权平均”特性可能促进“世界大同”,但实际AI正走向个性化,并可能制造新信息茧房。 **总结规律:** 1. 预测机制和方向比具体数字更可靠。 2. 倾向于高估短期变化速度,低估长期影响程度。 3. 容易忽略问题内部的“分布”差异(如失业影响集中在年轻群体)。 4. 留有餘地、分层表述的判断更经得起时间检验。 5. 一些根本性争议,三年时间仍不足以给出定论。 这次复盘旨在为未来的判断立下更审慎的规矩。

marsbit7小时前

三年之后:回看 2023 年我对 ChatGPT 的判断

marsbit7小时前

三年之后:回看 2023 年我对 ChatGPT 的判断

2023年3月,在GPT-4发布前,作者王健硕对ChatGPT的未来做出了二十项预测。三年后的2026年,他使用AI agent对这些判断进行回顾验证,评估其准确性。 **主要看对的方面:** 1. **RAG成为主流**:预测通过外部检索而非修改模型来解决知识更新和幻觉问题,这已成为行业标准架构。 2. **LUI(自然语言界面)兴起**:预测自然语言交互将催生巨大新产业,Agent、MCP协议等发展印证了这一点,但LUI是与GUI共存而非取代。 3. **机器人网络与新寻址系统**:预测Agent将自动协作并需要新寻址方式,MCP、A2A等协议正朝此方向发展。 4. **中国能做出可用大模型**:预测中美模型差距会迅速缩小,事实如此,但真正领先的国内厂商与其当初点名不同。 5. **AI无意识与图灵测试本质**:核心判断“AI无意识,图灵测试仅测表象”基本成立,但“绝无意识”的绝对论断被后续研究置于灰区。 **看错或看偏的方面:** 1. **GPT-4参数数量**:所传“100T参数”严重错误,实际约为1.8T。 2. **LLM的数学能力**:诊断“数学差需外挂工具”正确,但“不可能自行学会”的结论被后续“推理模型”在IMO夺金证伪。 3. **价值捕获**:预测价值在应用层,但现实中算力层(如英伟达)捕获了最大利润,模型层反而亏损。 4. **版权问题**:判断“生成物可能无法登记版权”正确,但认为能“规避侵权”则错误,已出现巨额侵权赔偿案例。 5. **信息茧房与世界大同**:机制上AI会将观点向众数平均,但AI正快速走向“千人千面”的个性化,可能制造新茧房而非消解极化。 6. **大模型成本**:预测“局部战争”和玩家涌入正确,但“5-10亿美元封顶”的成本估算与前沿训练实际花费严重不符。 **总结规律:** 1. 判断**方向和机制**比具体数字、程度更可靠。 2. 倾向于**高估短期变化速度,低估长期能力上限**。 3. 容易忽略**问题内部的分布差异**(如总量正确但部分群体受损)。 4. **留有餘地、分层表述**的判断更经得起时间检验。 5. 一些根本性争论,**三年时间不足以给出最终答案**。 这次回顾表明,在快速变化的领域,把握大方向比追求精确预测更重要,同时需警惕绝对化表述并承认认知的局限性。

链捕手10小时前

三年之后:回看 2023 年我对 ChatGPT 的判断

链捕手10小时前

交易

现货
合约
活动图片