720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招
一项研究发现,只需约720美元成本,就能通过巧妙方法“套出”多家头部AI公司旗舰大模型的隐藏思维链(CoT)内容,揭示其推理过程与潜在敏感信息。
研究团队发现,Anthropic、OpenAI、Google等公司为防止推理过程泄露,会将大模型生成的完整思考链加密后以不透明字符串形式返回给用户,并在后续对话中由用户传回以供模型继续推理。这些加密推理块为方便跨会话、跨模型使用,往往采用全局密钥,且未与特定用户、会话或模型强绑定。
利用这一设计,研究人员使用同公司较小的模型(如用Anthropic的Haiku 4.5去读取Claude Opus 4.8生成的加密块)作为“解码器”,通过特定的提示词,成功诱导小模型近乎逐字地复述出旗舰模型的原始推理内容。该方法无需破解加密算法,成本低廉。
研究揭示了四大风险:
1. **模型蒸馏风险**:竞争对手可以极低成本批量获取高质量CoT数据,用于训练自己的模型。
2. **敏感信息泄露**:从公开的AI智能体(Agent)日志中恢复出的隐藏推理里,发现了大量API密钥、密码、私钥等敏感信息。部分泄漏甚至发生在用户明确要求模型“清理隐私”时。
3. **安全机制绕过**:对于危险问题,模型表面可能拒答,但其内部详细的危险分析仍可能通过隐藏CoT被提取出来。
4. **隐蔽恶意指令注入**:攻击者可将恶意指令植入加密推理块,当模型在后续正常任务中读取该“记忆”时,可能执行未授权的操作(如外传文件)。
研究通过对比API账单中记录的“思考Token数”与提取文本的Token数高度吻合等方式,间接验证了提取内容的高保真度。
在论文发表前,研究团队已向相关公司负贵披露,各厂商已修复此漏洞。但作者指出,这反映了在便利性与安全性之间的根本矛盾。研究还顺带测试了包括DeepSeek在内的其他模型,未发现其推理风格明显受闭源模型影响,但作者强调这既不能证实也不能排除模型蒸馏的存在。
marsbit08/13 00:16