# 谷歌研究的所有文章

在 HTX 新聞中心流覽與「谷歌研究」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

GPT-5也会话到嘴边想不起来,谷歌测了450万次:钥匙丢了

谷歌研究发现,大模型如GPT-5和Gemini 3普遍存在“舌尖现象”——模型参数中存储了大量事实,但在被直接提问时,却有相当一部分无法成功回忆。这项名为《空货架,还是丢钥匙?》的研究提出“知识画像”框架,将事实状态分为五类,并基于WikiProfile基准(包含2150条维基事实)进行了约450万次测试。 关键发现是:模型的大部分错误并非因为“没学过”(编码失败),而是“取不出”(回忆失败)。在测试中,前沿模型能将95%-98%的事实存入参数,但直接提问的未回忆率高达26%-34%。即便开启“思考”链(thinking),仍有11%-12%无法想起。 研究指出了两个主要“堵塞点”:1. **冷门知识**:冷门与热门事实的存入率相差很小,但直接回忆率差距显著,表明长尾问题核心是提取困难,而非未学习。2. **反向提问**:模型在选择题中能识别反向关联,但在开放式生成任务中却难以回答,说明关联已存在,但提取方式依赖于训练时的语境。 “思考”链能显著帮助回忆那些已存储但直接提取失败的事实(找回40%-65%),其机制类似于人类的“扩散激活”,通过提及相关上下文来激活目标记忆。然而,若思维链中包含错误事实,反而可能增加幻觉。 研究还发现,单纯扩大模型规模主要改善的是知识存储(编码失败率下降),但对提升提取能力(回忆失败率)效果有限。在大型模型中,回忆失败已成为错误的主要来源。 因此,提升模型事实准确性的下一个关键,可能在于改进后训练和推理方法,以优化已存储知识的提取效率。这要求模型具备更好的“元认知”能力,即能够判断自己何时“想不起来”,从而主动采用更深入的思考策略。 **核心结论**:对于前沿大模型,事实性错误的瓶颈已从“存储不足”转向“提取困难”。未来的优化重点应是如何让模型更有效地调用其已学知识,而非仅仅继续扩充数据与参数。

marsbit10 小時前

GPT-5也会话到嘴边想不起来,谷歌测了450万次:钥匙丢了

marsbit10 小時前

活动图片