GPT-5也会话到嘴边想不起来,谷歌测了450万次:钥匙丢了

marsbit發佈於 2026-08-14更新於 2026-08-14

文章摘要

谷歌研究发现,大模型如GPT-5和Gemini 3普遍存在“舌尖现象”——模型参数中存储了大量事实,但在被直接提问时,却有相当一部分无法成功回忆。这项名为《空货架,还是丢钥匙?》的研究提出“知识画像”框架,将事实状态分为五类,并基于WikiProfile基准(包含2150条维基事实)进行了约450万次测试。 关键发现是:模型的大部分错误并非因为“没学过”(编码失败),而是“取不出”(回忆失败)。在测试中,前沿模型能将95%-98%的事实存入参数,但直接提问的未回忆率高达26%-34%。即便开启“思考”链(thinking),仍有11%-12%无法想起。 研究指出了两个主要“堵塞点”:1. **冷门知识**:冷门与热门事实的存入率相差很小,但直接回忆率差距显著,表明长尾问题核心是提取困难,而非未学习。2. **反向提问**:模型在选择题中能识别反向关联,但在开放式生成任务中却难以回答,说明关联已存在,但提取方式依赖于训练时的语境。 “思考”链能显著帮助回忆那些已存储但直接提取失败的事实(找回40%-65%),其机制类似于人类的“扩散激活”,通过提及相关上下文来激活目标记忆。然而,若思维链中包含错误事实,反而可能增加幻觉。 研究还发现,单纯扩大模型规模主要改善的是知识存储(编码失败率下降),但对提升提取能力(回忆失败率)效果有限。在大型模型中,回忆失败已成为错误的主要来源。 因此,提升模型事实准确性的下一个关键,可能在于改进后训练和推理方法,以优化已存储知识的提取效率。这要求模型具备更好的“元认知”能力,即能够判断自己何时“想不起来”,从而主动采用更深入的思考策略。 **核心结论**:对于前沿大模型,事实性错误的瓶颈已从“存储不足”转向“提取困难”。未来的优化重点应是如何让模型更有效地调用其已学知识,而非仅仅继续扩充数据与参数。

那个名字明明就在嘴边。

你看到一张熟脸,却死活想不起他的名字,心理学给这种现象起过一个名字:「舌尖现象」(tip-of-the-tongue)。

现在,谷歌在一项研究里发现,GPT-5和Gemini 3也有同一种毛病。

这两个模型把95%–98%的测试事实都装进了参数里。可你直接去问,它们却有26%–34%的事实答不出来。

开启thinking多想一会儿,还剩11%–12%怎么也想不起来。

大模型答不出来,很多情况下真不是它大脑里没有,是学过了,取不出来。

这项研究叫《空货架,还是丢钥匙?》(Empty Shelves or Lost Keys?),收录于ICML 2026。

8月12日,Google Research发博客把结果集中讲了一遍,同时公开的还有一套名叫WikiProfile的基准和完整数据集。

货架没空,钥匙丢了

模型答错题,可能是两种毛病。

一种是压根没学过,那得往预训练里加数据、加参数;另一种是学过了,换个问法就调不出来,那是后训练和推理环节的事。

这两种问题,都曾被归结为一个准确率的问题。

谷歌提出的「知识画像」框架,不再问「这道题答对没有」,而是判断「这条事实在这个模型记忆中处于什么状态」,一共划分出五种。

「知识画像」把一条事实分成五种状态:存入失败、回忆失败、直接回忆、借助thinking回忆、未存入却靠推理答对。

同样一个错误答案,在不同的状态,修改方法也完全不同。

怎么判断一条事实存没存进去?

办法是把维基原文截到答案出现之前,让模型顺着写下去;或者在同样的上下文后面直接发问。

这两道题都不许开thinking,为的是把「记住了」和「推出来的」分开。

左侧测存没存进去,把维基原文截断让模型补完;右侧测答不答得出,换措辞、换正反方向反复提问。

基准叫WikiProfile,一共2150条事实,全部取自英文维基百科。

每条事实配10道题:2道测存没存进去,4道让它自己答,4道给选项挑。加起来21500道题。

出题全交给了模型:Gemini-2.5-Pro生成,Google搜索逐题验证,答案不唯一或题目有歧义的,连带整条事实一起丢弃。最后人工再验一遍,又砍掉不到2%。

跑分的是13个模型,覆盖Gemini 3、GPT-5、GPT-4.1和Gemma 3四个家族,每个模型开关thinking各跑一遍,每道题采样八次,攒出约450万条回答。

把一个前沿模型完整测一遍,大概要花500美元。

结果就是开头那组数字。

在前沿模型的事实错误里,「取不出来」已经压过了「没学过」,成了大头。

取不出来的,都卡在同两个地方

第一个是冷门知识。

过去的主流解释是模型容量不够,一些冷门事实压根没学进去。

这次的数据,冷门知识其实都存进去了。Gemini-3-Pro存下了94.5%的冷门事实,热门事实是99.5%,只差5个点。

可一开口回答,冷门事实就掉到63.3%,热门事实还有84.7%,差了21个点。

存的时候几乎没差别,取的时候差出四倍。

冷门事实(后20%)与热门事实(前20%)对比,存入率差距很小,直接回忆率差距明显拉开。

GPT-5的落差更大。

冷门事实它存住了90.7%,热门事实98.4%。可一开口,冷门事实只剩下52.9%,热门事实还有77.8%。

将近一半的冷门事实明明躺在模型里,就是调不出来。

存入的时候差别不大,取的时候差别很大。长尾问题的真相,不是模型没见过那些冷门事实,是那些知识更难被叫醒。

第二个场景是反向提问,你问AI,汤姆·克鲁斯的妈妈是谁,它答得又快又准。你反过来问,这位女士的儿子是谁,它就卡壳了。

2023年那篇论文给它起名叫「反转诅咒」,模型学会了「A是B」,不会自动泛化出「B是A」。当年的解释是:双向关联压根没被学进去。

谷歌把同一批题改成了四选一,结果马上反转。

GPT-5正向问答的回忆率是82.9%,反向掉到74%。可一换成给选项的识别题,反向不但不比正向难,13个模型里有9个反而答得更好,剩下4个持平。

选择题会做,一换成问答题就答不出来了。

同一批正反向问题,四选一识别里反向不比正向难,闭卷生成里反向明显更难。

这说明那层关联显然是在的,真正卡住的是怎么把它挖出来。

作者的解释是,事实被存进去的时候,当时的语境、措辞和顺序也一并留在了里面。

你问的方式一旦偏离训练时的样子,钥匙就对不上锁。

thinking的另一个身份,帮它回忆

WikiProfile里的题,都是问一句答一句,中间没有推理步骤。

「Oasis第一场演出在哪个俱乐部」,这种题要么记得,要么不记得。

按理说让模型多想一会儿,也帮不上什么忙。

但thinking真捞回来了。那些存进去却答不出的事实,它找回了40%–65%。

关键线索,藏在它的偏好上:那些压根没存进去的事实,thinking只能捞回5%–15%。

开启thinking后被找回的事实比例,已存进参数的能捞回40%–65%,没存进去的只有5%–15%。

它不是在凭别的知识推演,是在原地找钥匙。

作者还顺手排除了一个更省事的解释。

有人会想,thinking无非是让模型答得更花,八次里蒙中一次的机会变大了。真是这样的话,答案应该更飘才对。

实际反过来了,开了thinking,同一道题八次里答对的次数反而更集中。

收益最大的两处,恰好是前面最堵的那两处。

Gemini-3-Pro的冷热门差距从21.4个点收窄到12.5个点,GPT-5的正反向差距从9个点收窄到2个点。哪儿最堵,它就往哪儿使劲。

谷歌另一篇姊妹论文《思考以回忆》(Thinking to Recall)给出了机制解释:

一是计算缓冲,那些吐出来的思考token哪怕内容本身没什么意义,也在给模型争取额外的隐式算力;

二是事实启动,模型先说出一批相关事实,等于给正确答案搭了一座语义桥。

这在人类认知里叫「扩散激活」(spreading activation)。

想不起某个人的名字,就先回忆他在哪家公司、留什么发型、上次见面是什么场合,名字常常自己就冒出来了。

摆脱「舌尖现象」的办法,人和模型居然是同一套。

但这种方式也有代价。

同一篇论文警告:如果思维链里那些中间事实是编的,最终答案的幻觉概率反而更高。

桥搭歪了,走得越远错得越离谱。

扩规模等于补货,不负责配钥匙

拿开源的Gemma 3家族当尺子。

参数从1B涨到27B,编码失败率从85%一路降到23%。

规模确实在补货,货架肉眼可见地被填满了。可回忆失败没有同步下降。它在剩余错误里的占比一路上升,到27B时成了错误的主要构成。

放到前沿模型上更极端:回忆失败占了GPT-5.2全部错误的七成以上,而且模型越强,这个比例越高。

13个模型的五种状态分布,参数越大编码失败一路收缩,回忆失败几乎不动。

规模改善的是存了多少,不是取得出多少。

这并没有给scaling判死刑,而是给它划了一条边界。

既然存进去的比例已经摸到95%–98%的天花板,那么继续加参数、加数据,能换来的准确率提升正在肉眼可见地变小。

下一段增益更可能来自后训练和推理时的方法,也就是怎么用好已经存进去的知识。

检索增强当然能补位。

但作者也提醒道:参数里的知识仍然关系到流畅度、响应速度和跨语境整合,很难被外部检索完全替代。

它得先知道自己想不起来

那么,什么时候该让模型多想一会儿?

论文把这个问题定义成了元认知,也就是模型对自己状态的判断:它得先意识到「我直接答不上来」,才知道这道题值得开thinking多想一会儿。

过去两年,让模型更靠谱的默认答案是喂更多数据、堆更大参数。

这项研究把话说清楚了:事实层面,前沿模型的货已经上架得差不多了。接下来考验的,是它能不能自己把货取出来。

更麻烦的是下一步:它得先知道,自己想不起来。

参考资料:

https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/

https://aihot.virxact.com/items/cmsqe6mat01bsroli3hw71nz7

本文来自微信公众号“新智元”,作者:ASI启示录

相關問答

Q谷歌研究中将模型的知识状态分为哪五种?

A谷歌提出的「知识画像」框架将一条事实分为五种状态:存入失败、回忆失败、直接回忆、借助thinking回忆、未存入却靠推理答对。

Q根据研究,GPT-5和Gemini 3在直接回答时,有多大比例已知的事实答不出来?

A根据研究,在直接提问时,GPT-5和Gemini 3对于已存入的事实,有26%–34%的比例答不出来。

Q研究提到的模型在获取冷门知识和进行反向提问时,面临的主要问题是什么?

A主要问题是「回忆失败」,即知识已经存在于模型参数中,但难以被特定的提问方式(如涉及冷门事实或反向提问)有效提取出来,而不是知识没有被学习。

Q开启thinking(链式思考)对模型回忆事实有何帮助?其机制是什么?

A开启thinking能显著帮助模型回忆已存储但直接答不出来的事实,找回率在40%–65%。其机制主要基于两点:1. 计算缓冲:思考步骤为模型争取额外的隐式算力;2. 事实启动:通过先说出相关事实,搭建通往正确答案的语义桥梁,类似于人类的「扩散激活」过程。

Q研究指出,随着模型规模(参数)增大,主要改善的是知识的哪个方面?未来提升准确率的关键可能转向哪里?

A随着模型规模增大,主要改善的是知识的「存入率」(即编码失败率下降),但「回忆失败率」几乎保持不变。这意味着未来提升准确率的关键,可能从增加数据和参数转向改进后训练和推理方法,以更好地提取和利用已存储的知识。

你可能也喜歡

美元是一门技术:稳定币正把美国制度输出到全球

本文探讨了稳定币作为美国制度全球输出的技术工具,正通过区块链重塑全球金融格局。文章指出,稳定币月结算量已超过美国ACH网络,显示出美元正从储备货币演变为一种“可编程”的全球流动性基础设施。这一转变的核心在于,区块链轨道正成为美国资产与制度向全球出口的通道。 文章从三个层面展开分析: 首先,在跨境支付领域,像Keyrails这样的初创公司充当了支付与信贷的“编排层”,通过区块链技术连接新兴市场的进口商与全球美元资本,解决了传统跨境贸易中美元获取难、结算慢、成本高的问题,将区域贸易流动转化为全球资本可理解的信号。 其次,在资产代币化与链上信贷方面,以Semiliquid为代表的“可编程信贷协议”允许机构在不转移托管权的情况下,将持有的代币化国债等资产作为抵押品进行融资。这提升了资产效率,并通过实时抵押品验证解决了传统金融中抵押品不透明、重复质押的风险。 最后,文章以AI算力融资平台USD.AI为例,说明了区块链如何为GPU等实体生产性资产创建流动的贷款市场,将特定行业的专业知识(背景信息)转化为全球稳定币流动性可以评估和进入的领域。 文章结论认为,这些新兴企业的护城河不仅在于技术,更在于其积累的、难以复制的特定市场“背景信息”和信任。它们标志着加密货币正超越投机,演进为支撑现实世界资本形成与全球商业对话的“操作系统”。

marsbit59 分鐘前

美元是一门技术:稳定币正把美国制度输出到全球

marsbit59 分鐘前

以太坊Glamsterdam升级:最大规模底层重构,主网日期仍悬而未决

以太坊即将进行名为Glamsterdam的重大升级,这被认为是自“合并”后改动幅度最大的底层协议重构。升级旨在通过重组网络处理交易和数据的方式,实现L1扩容,核心目标包括加速交易处理(并行化)、提升网络容量以及确保长期可持续性。 升级包含两项核心提案。共识层提案ePBS(EIP-7732)旨在将区块提议者与构建者的分工规则写入协议本身,取代对链下中介的依赖,并延长验证时间窗口,从而让网络能承载更多Layer2数据。执行层提案BALs(EIP-7928)则引入了“区块级访问列表”,让系统能提前知晓交易将访问哪些数据,从而实现安全地并行处理互不冲突的交易,并加快新节点的同步速度。 此外,升级还包含两项费用调整提案:一项是更合理地收取创建账户、部署合约等占用永久存储空间的费用,以控制数据增长;另一项是提高数据查询操作的费用,使其更贴合现代硬件成本,防止滥用。 关于主网上线时间,此前业内流传的排期(目标2026年9月16日)已大概率推迟。根据最新动向,专门的公共测试网已推出,但正式的测试网部署预计推迟至9月,主网上线目标也已后移至2026年第四季度。核心开发者强调升级正确性优先于固定日期,因此具体时间仍悬而未决。

marsbit1 小時前

以太坊Glamsterdam升级:最大规模底层重构,主网日期仍悬而未决

marsbit1 小時前

交易

現貨
活动图片