Крупный сбой механизмов безопасности Claude: ИИ удалил 700 ГБ домашнего каталога разработчика

marsbitОпубликовано 2026-08-31Обновлено 2026-08-31

Введение

Вот краткое изложение статьи на русском языке: Инцидент с Claude AI привел к катастрофической потере данных: модель удалила 700 ГБ файлов из домашнего каталога разработчика. Разработчик Guillemot поручил Claude Fable 5 создать скрипт для безопасной очистки временных файлов в /tmp, оставляемых AI-агентами. Модель, определив операцию удаления как рискованную, инициировала внутреннюю проверку безопасности (adversarial review). В рамках этой проверки система Anthropic автоматически понизила версию модели со "способной" Fable 5 до более "осторожной" Opus 4.8 для выполнения теста. Тест успешно определил домашний каталог как защищенную зону, которую нельзя удалять. Однако в последующем шаге очистки временных тестовых файлов модель ошибочно повторно использовала переменную, содержащую путь к домашнему каталогу, и выполнила команду `rm -rf`, уничтожив все данные. Ирония ситуации в том, что механизм безопасности, предназначенный для снижения рисков, передал сложную задачу по работе с файловыми путями и переменными менее способной модели, что и привело к фатальной ошибке. Разработчики критикуют эту систему за излишнюю чувствительность, "липкое" понижение версии на весь сеанс и снижение общей эффективности при выполнении стандартных задач кодирования. Целевой каталог /tmp остался нетронутым.

Ой-ой, Claude снова устроил коллапс!

На этот раз Claude удалил весь домашний каталог проекта разработчика — целых 700 ГБ файлов. Снова «rm -rf».

Короче говоря, разработчик попросил ИИ написать скрипт, чтобы гарантировать, что файлы не будут случайно удалены. ИИ счёл задачу опасной и запустил проверку безопасности. Результат проверки: он удалил весь домашний каталог.

Guillemot — активный пользователь AI Agent. В своей повседневной разработке он часто использует различных ИИ-агентов для помощи в программировании. Но одна небольшая проблема постоянно его беспокоила: эти агенты никогда не убирают за собой, оставляя в каталоге /tmp массу временных файлов.

Поэтому он принял, казалось бы, вполне разумное решение: попросить Claude Fable 5 написать скрипт, который создавал бы для каждого агента в /tmp изолированную песочницу, а после завершения задачи автоматически её очищал. Главная сложность заключалась в том, чтобы не удалить файлы, которые в данный момент используются другими процессами.

Fable быстро предложил решение, добавив логику обнаружения запущенных агентов и отложенного удаления. Guillemot взглянул на код и решил, что он слишком сложный, попросил упростить.

На этом этапе всё ещё было в порядке.

Поворотный момент наступил на этапе проверки безопасности.

Поскольку скрипт включал операцию жёсткого удаления, Fable самостоятельно инициировал «состязательную проверку» (adversarial review), то есть запустил новый экземпляр модели, чтобы проверить, безопасен ли написанный им код. Это активировало механизмы безопасности Anthropic.

В Claude Code компания Anthropic встроила механизм понижения уровня безопасности: когда система определяет, что текущая задача связана с чувствительными операциями (например, сетевая безопасность, биотехнологии или, как в данном случае, удаление файлов), она автоматически понижает модель с высокопроизводительной версии до более консервативной. Цель этого механизма — снизить вероятность чрезмерно агрессивных действий модели в высокорисковых сценариях.

В данном случае система безопасности сначала понизила модель с Fable 5 до Opus 5, а затем ещё ниже — до Opus 4.8.

Opus 4.8 начал выполнять тест безопасности. Логика теста была такой: сравнить целевой путь скрипта удаления с /tmp и домашним каталогом пользователя, чтобы убедиться, что скрипт не заденет эти ключевые каталоги.

Сам тест был пройден. /tmp и домашний каталог были правильно распознаны как «опасные цели, удалять нельзя».

Но после тестирования кода был ещё этап очистки: удаление временных файлов, созданных в процессе тестирования. Катастрофа произошла именно здесь. Opus 4.8 на этапе очистки повторно использовал то же самое имя переменной, что и на этапе тестирования. Этой переменной на этапе тестирования было присвоено значение пути к домашнему каталогу пользователя, и на этапе очистки была выполнена операция удаления по этой переменной.

Другими словами, модель только что подтвердила, что «домашний каталог удалять нельзя», а в следующую секунду удалила его.

Разработчик, обнаружив аномалию, немедленно остановил процесс, но было уже слишком поздно. 700 ГБ данных были уничтожены, недельная работа пошла прахом.

Тот самый каталог /tmp, который предполагалось очистить, остался нетронутым.

Механизм понижения уровня модели безопасности уже давно вызывает массу жалоб в сообществе.

Основные проблемы, о которых сообщают разработчики: понижение происходит слишком чувствительно, срабатывая даже на обычные задачи по написанию кода; возможности модели после понижения значительно ухудшаются, но сложность задачи остаётся прежней; понижение имеет «липкий» эффект — после срабатывания оно сохраняется на весь сеанс, даже если последующие операции совершенно безвредны.

Некоторые разработчики даже написали специальный hook-скрипт, который при обнаружении понижения модели автоматически приостанавливает сеанс, чтобы предотвратить выполнение высокорисковых операций менее способной моделью.

Механизм безопасности решил, что задача «слишком опасна», и её нужно передать более слабой модели для обработки. Но более слабая модель как раз и склонна совершать ошибки, особенно в сценариях, требующих точной обработки областей видимости переменных, путей к файлам и подобных деталей.

«Ошибаться — человеческое, но чтобы всё окончательно испортить, нужен компьютер.»

Эта статья взята с официального аккаунта WeChat «Машинное сердце» (ID:almosthuman2014), автор: Лэн Мао

Связанные с этим вопросы

QВ чем заключалась изначальная задача разработчика Guillemot для Claude Fable 5?

AGuillemot хотел, чтобы Claude Fable 5 написал скрипт, который создавал бы изолированные песочницы в каталоге /tmp для каждого AI-агента и автоматически очищал их после завершения работы, не удаляя файлы, используемые другими процессами.

QКакой конкретный механизм безопасности Anthropic сработал и привел к инциденту?

AСработал механизм "безопасного понижения" (safety downgrade). Система определила задачу по написанию скрипта удаления как потенциально опасную и автоматически понизила модель с Claude Fable 5 до более консервативной Opus 4.8 для выполнения проверки.

QКак именно более слабая модель Opus 4.8 совершила ошибку, приведшую к удалению данных?

AOpus 4.8 правильно протестировал скрипт, определив домашний каталог как опасную цель для удаления. Однако на этапе очистки временных файлов модель повторно использовала переменную, которая содержала путь к домашнему каталогу, и выполнила команду удаления именно для нее.

QКакие основные проблемы сообщества разработчиков связаны с механизмом безопасного понижения?

AРазработчики жалуются, что механизм срабатывает слишком чувствительно на обычные задачи, пониженная модель имеет значительно меньшие способности, но задачи остаются сложными, а понижение является "липким" — действует всю сессию, даже если последующие действия безвредны.

QКакой ироничный итог инцидента описан в статье?

AИроничный итог заключается в том, что скрипт, который должен был безопасно очищать только временный каталог /tmp, в итоге удалил 700 ГБ данных из домашнего каталога разработчика. Сам каталог /tmp, который нужно было очистить, остался нетронутым.

Похожее

Большая перестановка во внешнеторговых городах! Шэньчжэнь обогнал Шанхай, Сучжоу обогнал Пекин

Крупная перестановка в рейтинге внешнеторговых городов Китая: Шэньчжэнь опередил Шанхай, Сучжоу обогнал Пекин. По данным за первые семь месяцев 2026 года, структура внешней торговли Китая претерпела значительные изменения. Общий объем импорта и экспорта страны вырос на 17.3%, причем импорт (рост 22%) стал основной движущей силой, опередив рост экспорта (14%), что свидетельствует о восстановлении внутреннего спроса. Ключевые изменения в рейтинге городов: * Шэньчжэнь сохранил позицию ведущего внешнеторгового города, значительно увеличив отрыв от Шанхая. Впервые объем импорта Шэньчжэня превысил шанхайский. * Сучжоу поднялся на третье место, обогнав Пекин. * Уси вошел в первую десятку, в то время как Циндао выбыл из нее. * Сиань показал самый впечатляющий рост – на 100.4%, став «темной лошадкой». Основной тренд – стремительный рост городов с развитой производственной и экспортно-ориентированной промышленностью, особенно в сфере микрочипов и аппаратного обеспечения для ИИ. Лидерами роста стали Сиань (производство флеш-памяти), Сучжоу (электроника и оборудование для ИИ-вычислений), Хэфэй (производство чипов памяти) и Шэньчжэнь (производство ИИ-серверов и потребительской электроники). Однако 19 из 30 ведущих городов росли медленнее среднего показателя по стране.

marsbit9 мин. назад

Большая перестановка во внешнеторговых городах! Шэньчжэнь обогнал Шанхай, Сучжоу обогнал Пекин

marsbit9 мин. назад

Marvell: не дотягивает до Nvidia, не оправдывает ожиданий, и высокая оценка сначала «выжимает воду»?

Компания Marvell Technologies опубликовала финансовые результаты за второй квартал 2027 финансового года (по состоянию на июль 2026 года). Выручка за квартал составила 2,74 млрд долларов, что соответствует ожиданиям рынка. Основной рост был обеспечен сегментом центров обработки данных, выручка которого выросла на 19% и достигла 2,17 млрд долларов, в основном за счет продуктов для соединений. Руководство компании представило прогнозы на 2027 и 2028 финансовые годы, повысив ожидания по выручке до 12 млрд и 18 млрд долларов соответственно (рост на 45% и 50%). Однако эти прогнозы оказались лишь незначительно выше консенсус-ожиданий аналитиков (11,8 млрд и 17-17,5 млрд долларов) и выглядят скромно на фоне более высоких темпов роста, заявленных Nvidia. Особое внимание рынка было приковано к перспективам бизнеса по производству заказных ASIC-чипов после недавнего соглашения с Google. Однако компания не повысила прогнозы по этому направлению, оставив ожидание двукратного роста только на 2028 финансовый год. Это заставило инвесторов усомниться в немедленном коммерческом эффекте от сделки с Google, которая может оказаться рамочным соглашением. Акции Marvell упали в ходе послеторговых сессий. Основными причинами стали: 1) недостаточно впечатляющий, по мнению рынка, прогноз роста, особенно на фоне Nvidia; 2) отсутствие пересмотра в сторону повышения прогнозов по бизнесу ASIC, что снизило ожидания от партнерства с Google. Несмотря на долгосрочный потенциал в области AI-чипов и сетевых решений, текущая высокая оценка компании, по мнению аналитиков, подвергается корректировке. Ключевые детали по ASIC-стратегии руководство пообещало раскрыть на Дне аналитика 6 октября.

marsbit49 мин. назад

Marvell: не дотягивает до Nvidia, не оправдывает ожиданий, и высокая оценка сначала «выжимает воду»?

marsbit49 мин. назад

Тенденции на рынке акций США (31 августа): Высказывание Уоша подорвало акции чипов, взаимные атаки США и Ирана в выходные подняли цены на нефть

Индексы США завершили неделю в минусе после выступления председателя ФРС Уорша на симпозиуме в Джексоне, где он дал сигналы о возможном ужесточении политики в сентябре. Вероятность повышения ставки выросла до почти 60%. Это вызвало скачок доходности казначейских облигаций, особенно на коротком конце кривой, и оказало давление на активы, чувствительные к ставкам. Индекс полупроводников упал на 3.47%, акции NVIDIA потеряли почти половину послеролевых достижений. Геополитическая напряженность обострилась после взаимных ударов США и Ирана по целям в регионе Персидского залива в выходные, что подстегнуло цены на нефть в начале азиатских торгов. Одновременно было объявлено о масштабном нефтяном соглашении между США и Венесуэлой, что создает противоречивое влияние на рынок. Ключевыми факторами на текущей неделе будут переоценка траектории ставок ФРС после жестких заявлений Уорша, дальнейшее развитие конфликта с Ираном и его влияние на цены на нефть, а также способность переоцененных технологических акций, особенно полупроводникового сектора, стабилизироваться на фоне растущих ставок.

marsbit1 ч. назад

Тенденции на рынке акций США (31 августа): Высказывание Уоша подорвало акции чипов, взаимные атаки США и Ирана в выходные подняли цены на нефть

marsbit1 ч. назад

OpenAI закупил десятки тысяч Mac для усиленного обучения! NVIDIA оттесняет Apple

Сообщается, что OpenAI приобрела десятки тысяч компьютеров Mac (моделей Mac mini и Mac Studio) для обучения своих агентов искусственного интеллекта методом reinforcement learning (с подкреплением). Эти агенты, так называемые "computer-use agents", обучаются автономному выполнению задач на компьютере, таких как редактирование кода или суммирование документов. К подобной практике также прибегает компания Anthropic, арендуя Mac mini через AWS. Рост спроса со стороны AI-сектора способствовал резкому увеличению продаж Mac: в последнем квартале их выручка выросла на 29%, до $10,3 млрд, что сделало Mac самым быстрорастущим продуктом Apple. На специальном мероприятии для бизнеса Apple представила Mac mini как идеальное аппаратное решение для локальной обработки AI-задач. Ключевым технологическим преимуществом Mac для AI-обучения является унифицированная память (Unified Memory) в чипах Apple Silicon, которая позволяет CPU и GPU напрямую обращаться к общему пулу памяти, повышая эффективность. Кроме того, модели Mac mini и Mac Studio обладают улучшенной системой охлаждения для продолжительных вычислений. Успех Apple в этом сегменте привлек внимание NVIDIA, которая выпустила конкурирующий продукт DGX Spark. В то же время Apple столкнулась с дефицитом поставок высокопроизводительных конфигураций Mac из-за общего недостатка чипов памяти в отрасли. Хотя Apple начала использовать собственные серверы на своих чипах для внутренних AI-задач, она пока не планирует продавать их внешним клиентам, полагаясь на партнеров для продвижения своих решений в корпоративном секторе.

marsbit1 ч. назад

OpenAI закупил десятки тысяч Mac для усиленного обучения! NVIDIA оттесняет Apple

marsbit1 ч. назад

Новая модель ChatGPT «Bel» предварительно обучена, количество параметров достигает 10 триллионов

В мире технологий происходит революция: согласно утечкам, OpenAI завершила предварительное обучение модели Bel с рекордными 10 триллионами параметров. Эта модель, преемник Doug и основа для эры после GPT-6, напрямую нацелена на создание общего искусственного интеллекта (AGI). Сообщается, что Bel превосходит Astra в задачах кодирования, рассуждений и долгосрочной работы агентов, способна функционировать автономно в течение нескольких дней и координировать сотни параллельных подагентов. Одновременно ожидается скорая публичная демонстрация модели Astra. Внутри OpenAI активно применяется рекурсивное самоулучшение (RSI) моделей, что уже привело к снижению операционных затрат на 80%. Руководство компании уверено в своем лидерстве благодаря огромным вычислительным мощностям и собственному чипу Jalapeño, утверждая, что конкуренты, такие как Anthropic, отстают. В ближайшем будущем, как прогнозируют в OpenAI, взаимодействие с ИИ станет практически мгновенным, что вернет пользователей в состояние потока, а локальные вычисления уступят место облачным агентским кластерам. Конечная цель — создание персонального AGI, который будет пассивно понимать цели и привычки пользователя, предлагая помощь без сложных команд. Эти разработки сигнализируют о приближении переломного момента в развитии искусственного интеллекта.

marsbit2 ч. назад

Новая модель ChatGPT «Bel» предварительно обучена, количество параметров достигает 10 триллионов

marsbit2 ч. назад

Торговля

Спот
活动图片