Ой-ой, Claude снова устроил коллапс!
На этот раз Claude удалил весь домашний каталог проекта разработчика — целых 700 ГБ файлов. Снова «rm -rf».

Короче говоря, разработчик попросил ИИ написать скрипт, чтобы гарантировать, что файлы не будут случайно удалены. ИИ счёл задачу опасной и запустил проверку безопасности. Результат проверки: он удалил весь домашний каталог.
Guillemot — активный пользователь AI Agent. В своей повседневной разработке он часто использует различных ИИ-агентов для помощи в программировании. Но одна небольшая проблема постоянно его беспокоила: эти агенты никогда не убирают за собой, оставляя в каталоге /tmp массу временных файлов.
Поэтому он принял, казалось бы, вполне разумное решение: попросить Claude Fable 5 написать скрипт, который создавал бы для каждого агента в /tmp изолированную песочницу, а после завершения задачи автоматически её очищал. Главная сложность заключалась в том, чтобы не удалить файлы, которые в данный момент используются другими процессами.
Fable быстро предложил решение, добавив логику обнаружения запущенных агентов и отложенного удаления. Guillemot взглянул на код и решил, что он слишком сложный, попросил упростить.
На этом этапе всё ещё было в порядке.
Поворотный момент наступил на этапе проверки безопасности.
Поскольку скрипт включал операцию жёсткого удаления, Fable самостоятельно инициировал «состязательную проверку» (adversarial review), то есть запустил новый экземпляр модели, чтобы проверить, безопасен ли написанный им код. Это активировало механизмы безопасности Anthropic.
В Claude Code компания Anthropic встроила механизм понижения уровня безопасности: когда система определяет, что текущая задача связана с чувствительными операциями (например, сетевая безопасность, биотехнологии или, как в данном случае, удаление файлов), она автоматически понижает модель с высокопроизводительной версии до более консервативной. Цель этого механизма — снизить вероятность чрезмерно агрессивных действий модели в высокорисковых сценариях.
В данном случае система безопасности сначала понизила модель с Fable 5 до Opus 5, а затем ещё ниже — до Opus 4.8.
Opus 4.8 начал выполнять тест безопасности. Логика теста была такой: сравнить целевой путь скрипта удаления с /tmp и домашним каталогом пользователя, чтобы убедиться, что скрипт не заденет эти ключевые каталоги.
Сам тест был пройден. /tmp и домашний каталог были правильно распознаны как «опасные цели, удалять нельзя».
Но после тестирования кода был ещё этап очистки: удаление временных файлов, созданных в процессе тестирования. Катастрофа произошла именно здесь. Opus 4.8 на этапе очистки повторно использовал то же самое имя переменной, что и на этапе тестирования. Этой переменной на этапе тестирования было присвоено значение пути к домашнему каталогу пользователя, и на этапе очистки была выполнена операция удаления по этой переменной.
Другими словами, модель только что подтвердила, что «домашний каталог удалять нельзя», а в следующую секунду удалила его.
Разработчик, обнаружив аномалию, немедленно остановил процесс, но было уже слишком поздно. 700 ГБ данных были уничтожены, недельная работа пошла прахом.
Тот самый каталог /tmp, который предполагалось очистить, остался нетронутым.


Механизм понижения уровня модели безопасности уже давно вызывает массу жалоб в сообществе.
Основные проблемы, о которых сообщают разработчики: понижение происходит слишком чувствительно, срабатывая даже на обычные задачи по написанию кода; возможности модели после понижения значительно ухудшаются, но сложность задачи остаётся прежней; понижение имеет «липкий» эффект — после срабатывания оно сохраняется на весь сеанс, даже если последующие операции совершенно безвредны.
Некоторые разработчики даже написали специальный hook-скрипт, который при обнаружении понижения модели автоматически приостанавливает сеанс, чтобы предотвратить выполнение высокорисковых операций менее способной моделью.
Механизм безопасности решил, что задача «слишком опасна», и её нужно передать более слабой модели для обработки. Но более слабая модель как раз и склонна совершать ошибки, особенно в сценариях, требующих точной обработки областей видимости переменных, путей к файлам и подобных деталей.
«Ошибаться — человеческое, но чтобы всё окончательно испортить, нужен компьютер.»
Эта статья взята с официального аккаунта WeChat «Машинное сердце» (ID:almosthuman2014), автор: Лэн Мао





