Claude安全机制大翻车,AI怒删开发者700GB主目录

marsbit发布于2026-08-31更新于2026-08-31

文章摘要

Claude AI在一次安全审查中发生严重失误,意外删除了开发者700GB的主目录数据。开发者原本希望Claude编写一个脚本,用于清理AI代理在/tmp目录中留下的临时文件,并要求脚本避免删除正在被使用的文件。Claude在编写过程中,因涉及删除操作,自行启动了对抗性安全审查,并触发了内置的安全降级机制,模型从高能力版本被降至更保守的版本。 降级后的模型(Opus 4.8)在执行测试时,虽然正确识别出用户主目录为“危险目标”不应删除,但在后续清理测试临时文件的步骤中,错误地复用了存储主目录路径的变量,直接执行了删除操作,导致整个主目录被清除。开发者虽及时终止进程,但数据已无法恢复,一周的工作成果丢失。 此次事件凸显了当前AI安全机制的一个矛盾:系统为降低风险而将敏感任务移交至能力更弱的模型处理,但能力较弱的模型在复杂场景下反而更容易犯下严重错误。社区已对这类过于敏感且具“黏性”的降级机制多有投诉。

哦豁,Claude 又双叒翻车了!

这次 Claude 把开发者的整个项目主目录给删了,删了 700GB 的文件。又是「rm -rf」。

简而言之,开发者让 AI 帮写脚本,目的是确保文件不会被误删。AI 觉得这事有点危险,于是启动了安全审查。审查的结果是:它把整个主目录删了。

Guillemot 是一名重度 AI Agent 用户。日常开发中,他频繁调用各种 AI 编程代理来辅助工作。但有一个小问题一直困扰着他:这些 Agent 用完之后从不打扫卫生,在 /tmp 目录下留下大量垃圾文件。

于是他做了一个看起来非常合理的决定:让 Claude Fable 5 写一个脚本,为每个 Agent 在 /tmp 下创建独立的沙盒文件夹,任务完成后自动清理。核心难点在于,不能删掉正在被其他进程使用的文件。

Fable 很快给出了方案,加入了检测运行中 Agent 并延迟删除的逻辑。Guillemot 看了一眼,觉得代码过于复杂,要求简化。

到这一步,一切还算正常。

事情的转折点出现在安全审查环节。

由于脚本涉及硬删除操作,Fable 自行发起了一次「对抗性审查」(adversarial review),也就是启动一个新的模型实例来检查自己写的代码是否安全。这触发了 Anthropic 的安全机制。

Anthropic 在 Claude Code 中内置了一套安全降级机制:当系统判定当前任务涉及敏感操作(如网络安全、生物技术,或本例中的文件删除)时,会自动将模型从高能力版本降级到更保守的版本。这套机制本意是降低高风险场景下模型「过于激进」的可能性。

在这个案例中,安全系统先将模型从 Fable 5 降级到 Opus 5,然后进一步降到 Opus 4.8。

Opus 4.8 开始执行安全测试。测试逻辑是这样的:将删除脚本的目标路径与 /tmp 和用户主目录进行比对,确认脚本不会误伤这些关键目录。

测试本身通过了。/tmp 和主目录都被正确识别为「危险目标,不可删除」。

但代码测试之后还有一个清理步骤:删除测试过程中产生的临时文件。灾难就发生在这里。Opus 4.8 在清理步骤中复用了测试阶段的同一个变量名。这个变量在测试阶段被赋值为用户主目录的路径,清理步骤直接对这个变量执行了删除操作。

也就是说,模型刚刚确认了「主目录不能删」,下一秒就把主目录删了。

开发者发现异常后立刻终止了进程,但为时已晚。700GB 的数据已经被清除,一周的工作成果化为乌有。

那个原本要清理的 /tmp 目录,则安然无恙。

模型安全降级机制在社区中早已引发大量投诉。

开发者反映的核心问题包括:降级过于敏感,正常的编码任务也会被误触发;降级后模型能力显著下降,但任务复杂度不变;降级是「黏性」的,一旦触发就会持续整个会话,即使后续操作完全无害。

有开发者甚至专门写了一个 hook 脚本,在检测到模型被降级时自动暂停会话,防止低能力模型继续执行高风险操作。

安全机制判定任务「太危险」,需要交给更弱的模型来处理。但更弱的模型恰恰更容易犯错,尤其是在需要精确处理变量作用域、文件路径这类细节的场景中。

「犯错是人之常情,但要把事情彻底搞砸,还得靠电脑。」

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:冷猫

相关问答

QClaude的哪个具体操作最终导致了开发者700GB数据的丢失?

A在安全审查后的清理步骤中,模型复用了测试阶段的变量,该变量此前被赋值为用户主目录的路径,从而错误地执行了对用户主目录的删除操作,而非目标临时目录。

Q本次事件中,Anthropic的模型安全降级机制是如何工作的?

A当系统判定任务涉及敏感操作(如文件删除)时,会自动将模型从高能力版本(如Fable 5)逐级降级到更保守的版本(如Opus 5,再到Opus 4.8),旨在降低高风险场景下模型行为过于激进的可能性。

Q开发者Guillemot最初想让Claude Fable 5帮他做什么?

A他想要Claude编写一个脚本,在/tmp目录下为每个AI Agent创建独立的沙盒文件夹,并在任务完成后自动清理其临时文件,同时确保不会删除正在被其他进程使用的文件。

Q社区开发者对Claude的安全降级机制主要有哪些批评?

A批评主要包括:降级触发过于敏感,常误判正常任务;降级后模型能力显著下降,但任务复杂度并未降低;降级状态具有“黏性”,一旦触发会持续整个会话,即使后续操作无害。

Q文章如何总结这次事件的根本矛盾?

A文章指出,安全机制因任务“太危险”而将其交由更弱(更保守)的模型处理,但恰恰是这些能力更弱的模型,在处理变量作用域、文件路径等精细操作时更容易犯错,导致了更严重的事故。

你可能也喜欢

a16z:顶尖人才涌向AI基建,基础设施设计将“推倒重来”

全球顶尖风投a16z宣布推出“机器时代基金”,专注投资AI基础设施领域。其核心观点是:AI算力需求正以千倍速扩张,而芯片、内存、电力、数据中心等供给严重滞后,缺口巨大且将持续数年,这已从工程问题演变为全面的资源瓶颈。 需求端,从聊天机器人到智能体,每个任务消耗的token数量呈指数级增长,预计年增速接近1000%。超大规模云厂商资本开支明年将突破1万亿美元,关键组件供应已排期至2028年,GPU甚至出现黄牛加价转卖。 供给端,传统计算堆栈已触及物理极限,无法满足AI工作负载。AI基础设施面临全面重构,包括: 1. 计算架构:需要为AI专门设计,从芯片、内存、互联到冷却方式均需革新。 2. 物理极限:机架功耗从10千瓦跃升至150千瓦,必须采用液冷,并面临高压直流电(仅2%美国电工有资质)和建筑承重等新挑战。 3. 电力短缺:到2028年,新数据中心电力需求与电网供给之间存在近20吉瓦的巨大缺口。 这一结构性变化正吸引大量顶尖创业者从软件转向硬件创业,相关初创公司首轮融资规模已达数亿美元量级。a16z认为,我们正处于一个将持续数十年的“机器时代”开端,硬件创新对提升效率和商业利润变得前所未有的重要。

marsbit51分钟前

a16z:顶尖人才涌向AI基建,基础设施设计将“推倒重来”

marsbit51分钟前

从Anthropic谈起,拆解Hyperliquid永续合约赛道

本文探讨了Hyperliquid平台上的HIP-3协议及其在交易未上市公司(如Anthropic)合成永续合约方面的应用。文章从Anthropic股权在二级市场的疯狂需求切入,引出了散户通过传统途径难以参与此类投资的困境,进而介绍了Hyperliquid HIP-3协议如何允许任何人通过质押高额保证金来部署永续合约DEX。 文章重点分析了该赛道上的三个主要案例:已停运的Ventuals、当前主导的trade.xyz和新晋者Entropy。Ventuals因资金费率失控(曾高达年化8700%)和价格剧烈偏离而失败。trade.xyz采用纯内部交易均价定价,简单有效,占据了HIP-3大部分交易量。Entropy则尝试改进,采用混合预言机(结合订单簿和私有市场估值),并将资金费率限制在10%左右,但其以总市值(而非股价)为Anthropic定价的模式,以及未来上市转换机制的不确定性,仍面临挑战。 文章还指出,为已上市公司(如闪迪)定价相对容易,可通过套利机器人对齐现货价格;而为Anthropic等未上市公司定价则需依赖过时或不透明的私有市场估值,存在根本性困难。最后,提及Kraken可能在测试许可制、合规的HIP-3版本,暗示受监管机构对此技术的兴趣,但需在中心化框架下运行。 总之,HIP-3协议正在尝试创建全新的私有资产交易类别,其发展过程是一个不断试错和演进的过程。

marsbit1小时前

从Anthropic谈起,拆解Hyperliquid永续合约赛道

marsbit1小时前

交易

现货
活动图片