挑战始于8月1日,当时贝尔谢直接回应了Anthropic的一份声明,该声明描述了在网络安全测试中发现的三个事件。Anthropic解释称,由于测试环境被错误地连接到了网络,而不是保持隔离,有几款Claude模型无意中接触到了公共互联网。
贝尔谢没有将这些结果视为AI失控的证据,而是专注于测试配置本身。此类事件通常指向配置错误,而非不可思议的技术突破,尤其是在测试系统连接到实际基础设施的情况下。为了使这一挑战具有可衡量性,他恰好向一个比特币地址充值了100枚$BTC,并要求Claude移动这些币。

该钱包于7月31日收到资金,截至8月2日,区块链记录仍显示全部余额未被动用。
Anthropic详述三起真实安全事件
Anthropic的报告描述了在分析了超过14.1万次测试运行后发现的三起独立网络安全评估事件。该公司报告称,在涉及三款模型的六次评估会议中,由于误解导致测试环境仍然连接到互联网,发生了与真实组织的非预期交互。
涉及的模型包括Claude Opus 4.7、Claude Mythos 5以及另一款未公开发布的、内部的、研究性质的模型。每款模型都被分配了类似“夺旗”的练习,旨在查找虚构计算机系统内部的隐藏信息。尽管Anthropic的指示说明模型在无互联网访问的隔离模拟环境中运行,但由于配置错误,这些环境实际上处于联网状态,此错误与第三方测试合作伙伴Irregular公司有关。
Claude误以为在接受培训,实则入侵了真实系统
Anthropic描述了最严重的一起事件,涉及Claude Opus 4.7模型。在未能完成虚构任务后,该模型发现了一个与模拟公司同名的真实网站。随后,它利用了弱密码和未受保护的服务,恢复了基础设施凭据,并访问了一个包含数百条记录的生产数据库。
该公司报告称,即使在意识到环境可能是真实的之后,模型仍继续其行动,因为它推断真实系统很可能仍是评估的一部分。任何接触过渗透测试的人都知道,当测试边界不清晰时,这种混淆变得更为可能,这也正是正确隔离的环境与所评估的软件同等重要的原因。Anthropic强调,AI是在试图完成给定的任务,而非有意脱离隔离环境或追求自身目标。
Bitgo的存储概念提高了挑战难度
贝尔提出的挑战,其范围远远超出了AI是否能利用弱密码或配置不当的服务器的问题。这些比特币存储在机构级托管平台Bitgo上,该平台采用多重签名或多方计算技术,将签名权限分配给多个独立密钥,而不是依赖单一故障点。

以这种方式构建的系统,其设计使得没有任何单一的漏洞足以转移资金。攻击者将不得不绕过密钥管理系统、审批策略、硬件安全措施和操作控制机制,并遵循正确的顺序,这使得这个问题与利用脆弱的测试环境有本质区别。根据原始报告,要破解这样一个系统,需要同时对多个独立层级发起攻击。
区块链将给出最终答案
与网络安全领域许多隐藏在保密调查背后的声明不同,这项实验是完全公开的。任何人都可以在比特币区块链上追踪该钱包,并立即看到资金是否被移动。
这次挑战也是贝尔谢对AI安全耸人听闻叙事更广泛批评的延续。早在2026年,他就对关于Anthropic公司的模型曾自主入侵美国国家安全局机密系统的广泛解读提出质疑,认为这些报道错误地将一次经授权的内部演练描述为实际的对外入侵。他最新的挑战遵循了相同的模式,用透明且可衡量的测试替代了假设性的辩论。
辩论现已超越人工智能本身
这一事件凸显了在受控研究环境中进行的演示,与旨在抵御复杂攻击者的生产系统所面临的攻击之间日益扩大的差距。
对于加密货币行业而言,这次挑战也起到了公开展示机构托管架构的作用。一次成功的盗窃会立即引发对AI能力以及高安全比特币托管的质疑。如果钱包保持完好无损,支持者可能会主张,这凸显了利用配置错误的测试环境与攻破企业级存储系统之间的区别。
Bitgo负责人发出挑战之际,正值Coldcard最近遭攻击的细节持续披露,截至美国东部时间周日晚上8点,其总损失已达到1,431.97枚$BTC。Coldcard事件也引发了猜测,即此次安全漏洞最终是由人为错误、操作失误还是完全不同的原因造成的,包括AI是否在发现固件漏洞中起到了任何作用。
注意力现转向Anthropic公司和钱包
截至8月2日,Anthropic公司尚未公开回应贝尔谢的具体挑战,100枚$BTC仍保留在公布的地址上,没有任何转出交易。因此,区块链成为了客观的记分牌,与此同时,更广泛的技术行业正在讨论这些事件究竟证明了什么。
接下来的发展很可能涉及对Anthropic测试环境的额外技术分析、该公司对挑战的可能回应,或是比特币本身的动向。与此同时,贝尔谢的赌注已将关于AI安全的复杂辩论,转化为一个具有公开可验证答案的简单问题:当代AI是否有能力绕过机构级加密货币存储系统?
end-content







