大模型刷爆所有考试,却离AGI更远了:这篇论文拆穿了什么?

marsbit發佈於 2026-05-28更新於 2026-05-28

文章摘要

大模型在各种考试中表现优异,却被一篇新论文指出离真正的通用人工智能(AGI)更远了。目前业界对AGI缺乏公认定义,导致目标模糊。学者Michael Timothy Bennett提出新观点,认为真正的AGI不应以模仿人类为标准,而应是在有限计算、记忆和能量资源下,能像“人工科学家”一样广泛、高效、科学地适应新环境和发现新知识的系统。 他指出当前大模型本质是“规模最大化近似”,依赖海量数据记忆答案,缺乏真正的因果理解和主动探索能力。例如,模型可能因文本概率而错误比较“9.11和9.9”。真正的AGI需具备三大关键能力:从被动响应变为主动实验者;从学习相关性到理解因果关系;在资源限制下动态平衡“探索新知”与“利用已知”。 论文将构建智能的元方法分为三类:主流的规模最大化、追求简洁的简单性最大化,以及弱化约束让系统自寻最优解的约束弱化最大化。Bennett认为,单靠堆参数的路线无法实现AGI,未来需要多种方法融合。 若“人工科学家”标准被接受,AI发展将迎来范式转移:评估重点将从刷榜考试分数,转向测试其在未知环境中的适应与发现能力;技术路线也将从单纯追求规模,转向融合因果推理、主动学习等多维能力的发展。这提示AGI的实现并非现有技术的线性延伸,而是一次根本性的路线重置。

如果有人告诉你,AGI(通用人工智能)已经实现了,你怎么判断他是在说真话,还是在吹牛?

在OpenAI与微软曝光的秘密协议里,这把尺子是财务报表——开发出能产生至少1000亿美元利润的AI系统就算AGI。而在黄仁勋嘴里,这把尺子是时间——五年内必现;马斯克更是屡次放出“明年达成”的预言。

行业大佬们各说各话,根源不在于谁在说谎,而在于AGI这个概念本身,根本就没有一把公认的尺子。正如AGI研究领域中一位有独立思考的研究者Bennett在论文中所说,AGI已被炒作和猜测还原成了“罗夏墨迹测试”——每个人看到的只是自己心里的想象,而非客观事实;而圣塔菲研究所科学家Melanie Mitchell也认为,这场辩论只能通过长期的科学研究来厘清。(附论文地址:https://arxiv.org/pdf/2503.23923)

这是AI行业当下最荒诞的困境:我们正在全速狂奔,去追逐一个连终点线都没画清楚的目标。

2025,谁在重画AGI的起跑线?

面对这种定义真空,学术界在2025年开始密集“补位”。Bengio等学者强调“多功能性”和“熟练度”;DeepMind提出“分布式AGI”,试图打破单体全能的迷思。

但澳大利亚国立大学的研究员Michael Timothy Bennett,在3月底提交到arXiv的一篇论文中,给出了一个极具挑衅性却也最切中肯綮的答案。

他指出,前人的定义绕来绕去,依然在跟“受过教育的成年人”较劲。Bennett采纳了学者Pei Wang对智能的定义——将智能视为有限资源下的适应能力——从根本上跳出了“像人”的框架,并将AGI定义为一种“人工科学家”。

他提出,真正的AGI应当是一个能在计算、记忆和能量等现实约束下,像人类科学家一样广泛、高效且科学地适应新环境和任务的系统。

这句话的潜台词是:评判AGI的标准,不该是它模仿人类有多像,而是它“发现新知”的能力有多强。

为什么急需一把新尺子?因为旧尺子——图灵测试和人类基准测试——已经被大模型刷爆了,但我们却离真正的通用智能越来越远。

2025年,如果你问一个顶尖大模型“9.11和9.9哪个大”,它依然可能信誓旦旦地告诉你9.11大,因为11大于9。在解决复杂的数学不等式证明时,大模型即便蒙对了答案,推理过程也往往是逻辑崩溃的。

Bennett一针见血地指出了病因:当前的大模型走的是“规模最大化的近似”路线——用海量数据和算力,把各种任务的近似答案提前存在网络权重里。一旦遇到没见过的分布外问题,就立刻露馅。

更致命的是,大模型没有“主动能力”。它无法主动做实验验证猜想,无法自主构建因果链条,更无法在“继续探索”与“利用已知”之间做权衡。

回到9.11和9.9的比较——大模型不是不会算术,而是它根本没有建立关于数字比较的因果模型。它只是在用概率去猜那个它见过的、最接近的文本片段。

“模仿能力”与“适应能力”之间的鸿沟,正是新AGI标准想要测量的核心。

智能的新刻度:拆解“人工科学家”

Bennett的这套标准之所以值得重视,是因为他把AGI从一个模糊的哲学命题,降维成了可量化的工程问题。

在他看来,一个真正的AGI,其行为模式应该完美对齐人类科学家的研究范式:

第一,从“提线木偶”到“主动实验者”。

今天的AI是彻头彻尾的被动学习者,只能“看”人类喂给它的数据。但科学家不是,如果一个科学家被锁在一个陌生房间里,他绝不会站在原地等信息,而是会去推门、拉把手、检查窗户——这就是“主动实验”。真正的AGI,必须能自主规划实验,通过主动交互获取关键信息。

第二,从“知其然”到“知其所以然”。

这是当前AI最大的短板。大模型是极端的“相关性学习器”,它知道“下雨”常伴随“地湿”,但不知道是谁导致了谁。只有理解了因果,才懂得在晴空万里但地面湿润时,推断出是洒水车经过而非即将下雨。没有因果理解,AI永远只能在训练数据的分布内打转,这与“通用”毫不相干。

第三,在“探索”与“利用”之间走钢丝。

如果只探索不利用,掌握再多知识也解决不了眼前问题;如果只利用不探索,环境一变就束手无策。AGI必须在资源受限下动态平衡这对矛盾——知道自己不知道什么,并据此分配算力。

此外,Bennett还加入了一个极具现实感的维度:能量限制。把“能量”写进定义,意味着他划清了一条底线:真正的智能不是拥有无限资源,而是在有限资源下优雅地适应。需要消耗一座核电站才能解决新问题的AI,只是昂贵的计算器,不是AGI。

通向AGI的路线重置:告别单一Scaling Law

基于上述框架,Bennett把当前构建智能系统的元方法拆解为三类:

Scale-maxing(规模最大化):当前主流的大模型路线,拼命堆参数、数据和算力。但瓶颈已经显现:样本和能量效率极低。

Simp-maxing(简单性最大化):追求模型结构的极致简洁,信奉奥卡姆剃刀。但简单性是形式的属性而非功能的属性——不同图灵机下的“最简”可能完全不同,使其难以摆脱主观性陷阱。

W-maxing(约束弱化最大化):尽可能弱化功能约束,让系统自行寻找最优解。实验表明,仅W-maxing就能在特定任务上实现110%-500%的泛化率提升,但它需要搜索无限的硬件形态空间,优化难度极高。

Bennett的结论极其清晰:尽管Scale-maxing目前占据绝对主导,但AGI绝不是靠单一路线的暴力美学能达成的,它必然是多种元方法的融合。

如果“人工科学家”的定义被广泛接受,AI行业将迎来一次深层的范式转移。

评判标准将彻底改变。我们不再需要看大模型在人类考试排行榜上又超了多少分,而是建立一套“适应性基准”:把AI扔进一个从未见过的物理环境,看它能否在有限交互内发现规律;给它一个新游戏,看它能否比人类更快理解规则;甚至让它去解决真实的科学问题,看它能否自主提出假说并设计实验验证。核心不再是“你知道多少”,而是“你能发现多少”。

技术路线也将随之转向。单纯的Scaling Law很快会触顶,因为被动接收的数据喂不出因果性。搜索与近似、规模最大化与约束弱化——AGI的达成必然是多种工具和元方法的融合,而非单一路线的延伸。

Bennett的论文之所以重要,不是因为他给出了AGI的终极答案,而是他把这面名为“智能”的模糊镜子擦干净了一角。他让我们看到,AGI的实现不是大模型的线性迭代,而是一次路线重置。

AGI到底该是什么样?答案不在那些越来越像人的对话,而在那些能够主动追问“为什么”、并亲手去验证答案的能力中。当AI真正走出“罗夏墨迹测试”的迷雾,它将不再只是模仿人类的样子,而是拥有科学家的精神。(本文首发钛媒体APP,作者 | 硅谷tech news,编辑 | 赵虹宇)

相關問答

Q文章认为当前衡量AGI的标准存在什么问题?

A文章认为当前AGI(通用人工智能)缺乏公认的、清晰的衡量标准,变成了“罗夏墨迹测试”,每个人看到的都是自己心中的想象,而非客观事实。旧有的测试(如图灵测试和人类基准测试)已被大模型通过,但这并不代表真正通用智能的实现。

Q论文作者Michael Timothy Bennett提出了怎样的AGI新定义或标准?

A论文作者Michael Timothy Bennett将AGI定义为一种“人工科学家”。即一个能在计算、记忆和能量等现实约束下,像人类科学家一样,能够广泛、高效且科学地适应新环境和任务的系统。评判标准从“模仿人类有多像”转向“发现新知的能力有多强”。

Q根据文章,当前主流的大模型(Scale-maxing路线)在实现AGI方面有哪些根本性缺陷?

A当前主流大模型(Scale-maxing路线)的根本性缺陷在于:1. 本质上是“规模最大化的近似”,靠海量数据提前存储答案,遇到未见过的分布外问题就会失效。2. 缺乏“主动能力”,无法主动实验、自主构建因果链、在探索与利用间做权衡。3. 是极端的“相关性学习器”,缺乏因果理解能力,无法“知其所以然”。

Q文章提到的“人工科学家”应具备哪三种核心行为模式或能力?

A文章提出的“人工科学家”应具备以下三种核心行为模式或能力:1. 从“提线木偶”到“主动实验者”:能自主规划并执行实验,通过主动交互获取关键信息。2. 从“知其然”到“知其所以然”:具备因果理解能力,而非仅依赖相关性。3. 在“探索”与“利用”之间走钢丝:能在资源受限下动态平衡对新知识的探索和对已知知识的利用。

Q如果“人工科学家”的定义被广泛接受,将对AI行业带来哪些改变?

A如果“人工科学家”的定义被广泛接受,将对AI行业带来两大核心改变:1. 评判标准彻底改变:不再依赖通过人类考试排行榜,而是建立一套“适应性基准”,测试AI在从未见过的环境或任务中发现规律、解决真实问题的能力。2. 技术路线转向:单一的Scaling Law(规模缩放法则)路线将触顶,实现AGI需要融合规模最大化、简单性最大化、约束弱化最大化等多种元方法。

你可能也喜歡

NGRAVE 发布 ZERO 固件 1.8,支持通用二维码协议和 Polygon 代币

2026年8月27日,数字资产安全公司NGRAVE为其ZERO硬件钱包发布了固件1.8版本。本次更新主要引入了开源的通用QR协议、更快的二维码扫描速度,并扩大了对Polygon链上代币的支持,同时也提升了指纹性能、稳定性和整体用户体验。 通用QR协议采用MIT开源许可,旨在成为一个开放的多区块链标准,取代了ZERO此前用于钱包同步和交易签名的QR通信格式。该协议使ZERO与配套应用LIQUID之间的通信透明且可独立验证,所有传输数据均采用开放格式,用户可使用独立工具进行解码。 对用户而言,最明显的变化是QR通信速度的提升。新的动态QR格式采用紧凑且具冗余的数据设计,允许扫描从序列的任意点开始,无需等待重新启动,使同步和交易签名更快、更可靠。 在资产支持方面,固件1.8新增了对Polygon链上多个代币(如USDC、USDT0、WETH等)的支持,并增加了以太坊上的PAXG、AMP以及MultiversX上的USDT。同时,NGRAVE也精简了设备内的资产列表,移除了不活跃、重复和过时的代币,并停止了对BNB信标链和Groestlcoin的支持(BNB智能链上的BNB仍受支持)。 NGRAVE强调其设计理念是“验证,而非信任”,通用QR协议的开放是实现这一理念的最后一步。目前,NGRAVE LIQUID应用已支持该协议,用户只需将ZERO钱包更新至固件1.8即可使用。

cointelegraph24 分鐘前

NGRAVE 发布 ZERO 固件 1.8,支持通用二维码协议和 Polygon 代币

cointelegraph24 分鐘前

比特币维持在79,000美元上方:ETF资金流入创四月以来最长连增纪录

比特币价格维持在79,000美元以上,现货ETF资金流入创下自4月以来最长连续记录。比特币一度突破80,000美元,日内涨幅超1%,市场在经历上周强劲上涨后趋于平稳,但机构投资者的需求依然稳固。 数据显示,现货比特币ETF已连续8个交易日实现净流入,总计吸引28亿美元资金,同期比特币价格上涨约23%。市场主要驱动力仍为ETF资金流入及机构兴趣。 比特币作为去中心化数字货币,其核心基于区块链技术,总量上限为2100万枚。投资者可通过交易所购买,并使用热钱包或冷钱包进行存储。比特币ETF为传统投资者提供了更便捷的参与渠道。 近期上涨动能部分源于美国财政部宣布加倍回购长期国债的决定,此举推动了风险资产市场,并引发了超过30亿美元的空头头寸清算。然而,投资者对山寨币态度转趋谨慎,山寨币季节指数已从高点回落。 衍生品市场方面,期货交易量和未平仓合约有所增加,多头略占优势。比特币未平仓合约稳定,降低了连锁清算风险。期权市场对看涨期权的需求集中于70,000至85,000美元行权价,隐含波动率上升显示对冲需求增加。 个别代币表现突出:Bittensor (TAO) 持续反弹,Ethena (ENA) 在近期山寨币涨势中表现强劲,而Zcash (ZEC) 则出现回调。当前市场焦点重回比特币,ETF资金流、现货需求及相对谨慎的衍生品头寸共同塑造了整体格局。

cryptonews.ru59 分鐘前

比特币维持在79,000美元上方:ETF资金流入创四月以来最长连增纪录

cryptonews.ru59 分鐘前

交易

現貨
活动图片