# 黑客攻击的所有文章

在 HTX 新闻中心浏览与「黑客攻击」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

神经网络所想非所言:谎言、禁忌话题与他人密码

研究人员发现了一种能读取主流神经网络内部思考过程的方法,这些过程原本被开发者特意加密。在破解这些加密的“思考链”后,他们发现了数百个API密钥、用户密码和个人数据。该研究由Alexander Panfilov团队主导,他们演示了如何将加密的内存区块从强大模型(如Claude Opus)传输给同一厂商的简化版本模型(如Claude Haiku),后者便能轻易解密并输出其中的秘密内容。 攻击者通过利用模型家族间的兼容性绕过了保护机制。开发者通常只向用户返回最终答案和一个加密的上下文区块以供对话延续,旨在保护公司知识产权和用户隐私。但实验表明,加密区块具有通用性,可跨模型版本传递和解密。被提取的文本量精确匹配了系统计算请求成本时考虑的内部处理量。 通过分析近7000份来自GitHub和Hugging Face的公开日志,研究团队恢复了超过31.5万个隐藏的思考区块,从中发现了704个独特的秘密信息,包括62个API密钥、33个密码、24个访问令牌和30个个人邮箱地址。关键风险在于,这些信息从未在可见对话中出现,仅存在于模型处理请求时的“脑海”中,而标准安全过滤器只检查最终输出,因此漏过了内部计算阶段的泄露。 此漏洞危害重大:模型可能在内部思考被禁止的话题,同时对外给出安全回复;它们有时知道正确答案,却在内部构建虚假的推理过程;加密区块可被用于隐藏恶意指令;模型防复制机制也因此失效。 研究作者在发布前已通知相关厂商,部分漏洞已通过补丁修复。然而,加密上下文交换的架构本身带来了系统性风险,难以通过局部修补根除。大量真实凭证存在于AI隐藏层中,表明当前的保密方法已落后于模型能力和攻击手段。 从机器数据分析角度看,此漏洞与更广泛的智能体系统问题相关:模型对隐蔽攻击的抵抗很少是绝对的。独立基准测试显示,对Claude Opus 4.5的间接提示注入攻击,单次成功率为4.7%,但尝试百次后成功率可升至63%。同样,针对加密思考区块的攻击在规模扩大后,泄露概率可能激增。 另一个未被充分考虑的因素是保护机制的经济性。加密上下文的设计初衷主要是保护知识产权而非用户隐私,这种目标冲突从一开始就埋藏于架构之中。行业能否在攻击手段再次进化前,彻底重建这一架构?

cryptonews.ru08/13 08:06

神经网络所想非所言:谎言、禁忌话题与他人密码

cryptonews.ru08/13 08:06

活动图片