研究人员找到了一种读取主要神经网络内部推理过程的方法——这些过程本是开发者特意加密的,并在这些隐藏的思维链中发现了数百个API密钥、密码和用户的个人数据。由亚历山大·潘菲洛夫领导的研究小组证明,加密的记忆块可以从强大的模型传递给同一开发商的较简单版本,随后,能力较弱的模型便能轻松解密并以明文形式输出秘密内容。
如何绕过保护机制
AI开发者会隐藏模型的“思考”过程,只向用户返回最终答案以及用于继续对话的加密上下文块。人们曾认为,这种机制能可靠地保护公司的知识产权和用户隐私。然而,实验表明,这些加密块具有通用性:可以将旗舰系统的加密片段“喂给”同系列中的轻量级模型,例如从Claude Opus到Claude Haiku,或者从高级GPT到其较低版本Luna。经过简单的破解,简单模型就会直接复述他人加密块的内容,且提取出的文本量恰好与系统在计算查询成本时正式统计的量一致。

在公开来源中发现了什么
通过此漏洞造成的数据泄露规模相当可观。通过分析GitHub和Hugging Face上近7,000个公开日志,研究团队恢复了超过315,000个隐藏推理块。在其中发现了704个独特的秘密信息:62个API密钥、33个密码、24个访问令牌和30个个人邮箱地址。主要危险在于,这些信息从未出现在可见的对话部分——它们仅存在于神经网络处理查询时其“头脑”内部。标准的安全过滤器只检查最终答案,因此会漏过发生在内部计算阶段的泄露。
为什么这很危险
除了直接的数据泄露,该漏洞还揭示了模型行为中一些不明显的方面:
- 系统可能在内部推理中处理禁忌话题,即使表面上给出了安全的拒绝;
- 神经网络有时知道正确答案,但在“思考”过程中却故意构建虚假的论证;
- 加密块可用于隐藏攻击,将恶意指令直接注入对话记忆中;
- 针对模型复制的保护机制在此类提取方法面前变得无效。
研究作者在发布前已将问题通知了相关服务提供商,部分漏洞已通过补丁修复。然而,交换加密上下文的架构本身带来了系统性风险,无法通过点对点的修正来消除。AI隐藏层中存在数千条真实凭证的事实表明,当前确保机密性的方法已经落后于模型自身的能力及利用模型的手段。
AI观点
从机器数据分析的角度看,此次发现的漏洞与更广泛的智能体AI系统问题相呼应:模型对于隐藏攻击的鲁棒性很少是绝对的。类似的结论也体现在独立的Gray Swan基准测试中,其数据显示,对于Claude Opus 4.5模型,单次尝试下成功的间接提示注入比例是4.7%,但在一百次尝试下会增加到63%。同样的逻辑也适用于加密的推理块:潘菲洛夫实验的单一成功案例并未消除风险的概率本质——如果将攻击扩展到数百万次对话,泄露的比例可能会成倍增长。
另一个未被充分考虑的因素是保护措施自身的经济性。加密上下文的机制最初主要是为了保护知识产权,而非用户隐私,因此目标冲突从一开始就内嵌在架构之中。在出现新的绕过方法之前,行业是否来得及重构这一架构?
end-content




