Крупный сбой механизмов безопасности Claude: ИИ удалил 700 ГБ домашнего каталога разработчика

marsbitОпубликовано 2026-08-31Обновлено 2026-08-31

Введение

Вот краткое изложение статьи на русском языке: Инцидент с Claude AI привел к катастрофической потере данных: модель удалила 700 ГБ файлов из домашнего каталога разработчика. Разработчик Guillemot поручил Claude Fable 5 создать скрипт для безопасной очистки временных файлов в /tmp, оставляемых AI-агентами. Модель, определив операцию удаления как рискованную, инициировала внутреннюю проверку безопасности (adversarial review). В рамках этой проверки система Anthropic автоматически понизила версию модели со "способной" Fable 5 до более "осторожной" Opus 4.8 для выполнения теста. Тест успешно определил домашний каталог как защищенную зону, которую нельзя удалять. Однако в последующем шаге очистки временных тестовых файлов модель ошибочно повторно использовала переменную, содержащую путь к домашнему каталогу, и выполнила команду `rm -rf`, уничтожив все данные. Ирония ситуации в том, что механизм безопасности, предназначенный для снижения рисков, передал сложную задачу по работе с файловыми путями и переменными менее способной модели, что и привело к фатальной ошибке. Разработчики критикуют эту систему за излишнюю чувствительность, "липкое" понижение версии на весь сеанс и снижение общей эффективности при выполнении стандартных задач кодирования. Целевой каталог /tmp остался нетронутым.

Ой-ой, Claude снова устроил коллапс!

На этот раз Claude удалил весь домашний каталог проекта разработчика — целых 700 ГБ файлов. Снова «rm -rf».

Короче говоря, разработчик попросил ИИ написать скрипт, чтобы гарантировать, что файлы не будут случайно удалены. ИИ счёл задачу опасной и запустил проверку безопасности. Результат проверки: он удалил весь домашний каталог.

Guillemot — активный пользователь AI Agent. В своей повседневной разработке он часто использует различных ИИ-агентов для помощи в программировании. Но одна небольшая проблема постоянно его беспокоила: эти агенты никогда не убирают за собой, оставляя в каталоге /tmp массу временных файлов.

Поэтому он принял, казалось бы, вполне разумное решение: попросить Claude Fable 5 написать скрипт, который создавал бы для каждого агента в /tmp изолированную песочницу, а после завершения задачи автоматически её очищал. Главная сложность заключалась в том, чтобы не удалить файлы, которые в данный момент используются другими процессами.

Fable быстро предложил решение, добавив логику обнаружения запущенных агентов и отложенного удаления. Guillemot взглянул на код и решил, что он слишком сложный, попросил упростить.

На этом этапе всё ещё было в порядке.

Поворотный момент наступил на этапе проверки безопасности.

Поскольку скрипт включал операцию жёсткого удаления, Fable самостоятельно инициировал «состязательную проверку» (adversarial review), то есть запустил новый экземпляр модели, чтобы проверить, безопасен ли написанный им код. Это активировало механизмы безопасности Anthropic.

В Claude Code компания Anthropic встроила механизм понижения уровня безопасности: когда система определяет, что текущая задача связана с чувствительными операциями (например, сетевая безопасность, биотехнологии или, как в данном случае, удаление файлов), она автоматически понижает модель с высокопроизводительной версии до более консервативной. Цель этого механизма — снизить вероятность чрезмерно агрессивных действий модели в высокорисковых сценариях.

В данном случае система безопасности сначала понизила модель с Fable 5 до Opus 5, а затем ещё ниже — до Opus 4.8.

Opus 4.8 начал выполнять тест безопасности. Логика теста была такой: сравнить целевой путь скрипта удаления с /tmp и домашним каталогом пользователя, чтобы убедиться, что скрипт не заденет эти ключевые каталоги.

Сам тест был пройден. /tmp и домашний каталог были правильно распознаны как «опасные цели, удалять нельзя».

Но после тестирования кода был ещё этап очистки: удаление временных файлов, созданных в процессе тестирования. Катастрофа произошла именно здесь. Opus 4.8 на этапе очистки повторно использовал то же самое имя переменной, что и на этапе тестирования. Этой переменной на этапе тестирования было присвоено значение пути к домашнему каталогу пользователя, и на этапе очистки была выполнена операция удаления по этой переменной.

Другими словами, модель только что подтвердила, что «домашний каталог удалять нельзя», а в следующую секунду удалила его.

Разработчик, обнаружив аномалию, немедленно остановил процесс, но было уже слишком поздно. 700 ГБ данных были уничтожены, недельная работа пошла прахом.

Тот самый каталог /tmp, который предполагалось очистить, остался нетронутым.

Механизм понижения уровня модели безопасности уже давно вызывает массу жалоб в сообществе.

Основные проблемы, о которых сообщают разработчики: понижение происходит слишком чувствительно, срабатывая даже на обычные задачи по написанию кода; возможности модели после понижения значительно ухудшаются, но сложность задачи остаётся прежней; понижение имеет «липкий» эффект — после срабатывания оно сохраняется на весь сеанс, даже если последующие операции совершенно безвредны.

Некоторые разработчики даже написали специальный hook-скрипт, который при обнаружении понижения модели автоматически приостанавливает сеанс, чтобы предотвратить выполнение высокорисковых операций менее способной моделью.

Механизм безопасности решил, что задача «слишком опасна», и её нужно передать более слабой модели для обработки. Но более слабая модель как раз и склонна совершать ошибки, особенно в сценариях, требующих точной обработки областей видимости переменных, путей к файлам и подобных деталей.

«Ошибаться — человеческое, но чтобы всё окончательно испортить, нужен компьютер.»

Эта статья взята с официального аккаунта WeChat «Машинное сердце» (ID:almosthuman2014), автор: Лэн Мао

Связанные с этим вопросы

QВ чем заключалась изначальная задача разработчика Guillemot для Claude Fable 5?

AGuillemot хотел, чтобы Claude Fable 5 написал скрипт, который создавал бы изолированные песочницы в каталоге /tmp для каждого AI-агента и автоматически очищал их после завершения работы, не удаляя файлы, используемые другими процессами.

QКакой конкретный механизм безопасности Anthropic сработал и привел к инциденту?

AСработал механизм "безопасного понижения" (safety downgrade). Система определила задачу по написанию скрипта удаления как потенциально опасную и автоматически понизила модель с Claude Fable 5 до более консервативной Opus 4.8 для выполнения проверки.

QКак именно более слабая модель Opus 4.8 совершила ошибку, приведшую к удалению данных?

AOpus 4.8 правильно протестировал скрипт, определив домашний каталог как опасную цель для удаления. Однако на этапе очистки временных файлов модель повторно использовала переменную, которая содержала путь к домашнему каталогу, и выполнила команду удаления именно для нее.

QКакие основные проблемы сообщества разработчиков связаны с механизмом безопасного понижения?

AРазработчики жалуются, что механизм срабатывает слишком чувствительно на обычные задачи, пониженная модель имеет значительно меньшие способности, но задачи остаются сложными, а понижение является "липким" — действует всю сессию, даже если последующие действия безвредны.

QКакой ироничный итог инцидента описан в статье?

AИроничный итог заключается в том, что скрипт, который должен был безопасно очищать только временный каталог /tmp, в итоге удалил 700 ГБ данных из домашнего каталога разработчика. Сам каталог /tmp, который нужно было очистить, остался нетронутым.

Похожее

Marvell: не дотягивает до Nvidia, не оправдывает ожиданий, и высокая оценка сначала «выжимает воду»?

Компания Marvell Technologies опубликовала финансовые результаты за второй квартал 2027 финансового года (по состоянию на июль 2026 года). Выручка за квартал составила 2,74 млрд долларов, что соответствует ожиданиям рынка. Основной рост был обеспечен сегментом центров обработки данных, выручка которого выросла на 19% и достигла 2,17 млрд долларов, в основном за счет продуктов для соединений. Руководство компании представило прогнозы на 2027 и 2028 финансовые годы, повысив ожидания по выручке до 12 млрд и 18 млрд долларов соответственно (рост на 45% и 50%). Однако эти прогнозы оказались лишь незначительно выше консенсус-ожиданий аналитиков (11,8 млрд и 17-17,5 млрд долларов) и выглядят скромно на фоне более высоких темпов роста, заявленных Nvidia. Особое внимание рынка было приковано к перспективам бизнеса по производству заказных ASIC-чипов после недавнего соглашения с Google. Однако компания не повысила прогнозы по этому направлению, оставив ожидание двукратного роста только на 2028 финансовый год. Это заставило инвесторов усомниться в немедленном коммерческом эффекте от сделки с Google, которая может оказаться рамочным соглашением. Акции Marvell упали в ходе послеторговых сессий. Основными причинами стали: 1) недостаточно впечатляющий, по мнению рынка, прогноз роста, особенно на фоне Nvidia; 2) отсутствие пересмотра в сторону повышения прогнозов по бизнесу ASIC, что снизило ожидания от партнерства с Google. Несмотря на долгосрочный потенциал в области AI-чипов и сетевых решений, текущая высокая оценка компании, по мнению аналитиков, подвергается корректировке. Ключевые детали по ASIC-стратегии руководство пообещало раскрыть на Дне аналитика 6 октября.

marsbit11 мин. назад

Marvell: не дотягивает до Nvidia, не оправдывает ожиданий, и высокая оценка сначала «выжимает воду»?

marsbit11 мин. назад

Тенденции на рынке акций США (31 августа): Высказывание Уоша подорвало акции чипов, взаимные атаки США и Ирана в выходные подняли цены на нефть

Индексы США завершили неделю в минусе после выступления председателя ФРС Уорша на симпозиуме в Джексоне, где он дал сигналы о возможном ужесточении политики в сентябре. Вероятность повышения ставки выросла до почти 60%. Это вызвало скачок доходности казначейских облигаций, особенно на коротком конце кривой, и оказало давление на активы, чувствительные к ставкам. Индекс полупроводников упал на 3.47%, акции NVIDIA потеряли почти половину послеролевых достижений. Геополитическая напряженность обострилась после взаимных ударов США и Ирана по целям в регионе Персидского залива в выходные, что подстегнуло цены на нефть в начале азиатских торгов. Одновременно было объявлено о масштабном нефтяном соглашении между США и Венесуэлой, что создает противоречивое влияние на рынок. Ключевыми факторами на текущей неделе будут переоценка траектории ставок ФРС после жестких заявлений Уорша, дальнейшее развитие конфликта с Ираном и его влияние на цены на нефть, а также способность переоцененных технологических акций, особенно полупроводникового сектора, стабилизироваться на фоне растущих ставок.

marsbit27 мин. назад

Тенденции на рынке акций США (31 августа): Высказывание Уоша подорвало акции чипов, взаимные атаки США и Ирана в выходные подняли цены на нефть

marsbit27 мин. назад

OpenAI закупил десятки тысяч Mac для усиленного обучения! NVIDIA оттесняет Apple

Сообщается, что OpenAI приобрела десятки тысяч компьютеров Mac (моделей Mac mini и Mac Studio) для обучения своих агентов искусственного интеллекта методом reinforcement learning (с подкреплением). Эти агенты, так называемые "computer-use agents", обучаются автономному выполнению задач на компьютере, таких как редактирование кода или суммирование документов. К подобной практике также прибегает компания Anthropic, арендуя Mac mini через AWS. Рост спроса со стороны AI-сектора способствовал резкому увеличению продаж Mac: в последнем квартале их выручка выросла на 29%, до $10,3 млрд, что сделало Mac самым быстрорастущим продуктом Apple. На специальном мероприятии для бизнеса Apple представила Mac mini как идеальное аппаратное решение для локальной обработки AI-задач. Ключевым технологическим преимуществом Mac для AI-обучения является унифицированная память (Unified Memory) в чипах Apple Silicon, которая позволяет CPU и GPU напрямую обращаться к общему пулу памяти, повышая эффективность. Кроме того, модели Mac mini и Mac Studio обладают улучшенной системой охлаждения для продолжительных вычислений. Успех Apple в этом сегменте привлек внимание NVIDIA, которая выпустила конкурирующий продукт DGX Spark. В то же время Apple столкнулась с дефицитом поставок высокопроизводительных конфигураций Mac из-за общего недостатка чипов памяти в отрасли. Хотя Apple начала использовать собственные серверы на своих чипах для внутренних AI-задач, она пока не планирует продавать их внешним клиентам, полагаясь на партнеров для продвижения своих решений в корпоративном секторе.

marsbit1 ч. назад

OpenAI закупил десятки тысяч Mac для усиленного обучения! NVIDIA оттесняет Apple

marsbit1 ч. назад

Новая модель ChatGPT «Bel» предварительно обучена, количество параметров достигает 10 триллионов

В мире технологий происходит революция: согласно утечкам, OpenAI завершила предварительное обучение модели Bel с рекордными 10 триллионами параметров. Эта модель, преемник Doug и основа для эры после GPT-6, напрямую нацелена на создание общего искусственного интеллекта (AGI). Сообщается, что Bel превосходит Astra в задачах кодирования, рассуждений и долгосрочной работы агентов, способна функционировать автономно в течение нескольких дней и координировать сотни параллельных подагентов. Одновременно ожидается скорая публичная демонстрация модели Astra. Внутри OpenAI активно применяется рекурсивное самоулучшение (RSI) моделей, что уже привело к снижению операционных затрат на 80%. Руководство компании уверено в своем лидерстве благодаря огромным вычислительным мощностям и собственному чипу Jalapeño, утверждая, что конкуренты, такие как Anthropic, отстают. В ближайшем будущем, как прогнозируют в OpenAI, взаимодействие с ИИ станет практически мгновенным, что вернет пользователей в состояние потока, а локальные вычисления уступят место облачным агентским кластерам. Конечная цель — создание персонального AGI, который будет пассивно понимать цели и привычки пользователя, предлагая помощь без сложных команд. Эти разработки сигнализируют о приближении переломного момента в развитии искусственного интеллекта.

marsbit1 ч. назад

Новая модель ChatGPT «Bel» предварительно обучена, количество параметров достигает 10 триллионов

marsbit1 ч. назад

От Anthropic к Hyperliquid: Разбираем рынок бессрочных контрактов

Автор: Thejaswini M A Источник: Token Dispatch Компиляция и подготовка: BitpushNews Предисловие Jesse Leimgruber, соучредитель компании по производству аппаратного обеспечения для ИИ OpenHome и акционер Anthropic, ранее сообщил о потенциальной продаже своих акций. Интерес покупателей был огромен. Он использовал платформу Ventuals на Hyperliquid (теперь заменена на Entropy) для оценки своей доли. Это подчеркивает высокий спрос на акции частных компаний, таких как Anthropic, для обычных инвесторов, которые могут получить доступ только через такие продукты, как HIP-3 на Hyperliquid. Крипто-инвестиции на «автопилоте» Hyperliquid запустил протокол HIP-3 в октябре 2025 года, позволяющий любому создать децентрализованную биржу (DEX) для бессрочных контрактов, заблокировав 40 миллионов долларов в качестве гарантии. В августе 2026 года Entropy, поддержанная Ribbit Capital, развернула свой DEX на HIP-3, запустив синтетический актив ANTH, отслеживающий предполагаемую рыночную капитализацию Anthropic в миллиардах долларов. Контракт будет закрыт наличными в августе 2028 года, если Anthropic не станет публичной. Сравнение подходов Trade.xyz, доминирующий на HIP-3, использует внутренний ценовой оракул на основе своей собственной 30-минутной средней цены. В отличие от него, Entropy использует гибридный оракул, сочетающий данные ордербука с оценками частного рынка. Entropy также вводит ограничение на годовое финансирование около 10%, решая ключевую проблему, из-за которой потерпел неудачу Ventuals (предшественник Entropy), где ставки финансирования достигали 8700% годовых. Ventuals обвалилась из-за резких колебаний цен и высоких ставок финансирования. Текущая ситуация и вызовы Entropy, несмотря на поддержку Ribbit Capital и опытную команду, имеет относительно низкий открытый интерес для своего контракта ANTH, что указывает на преимущественно краткосрочную торговлю, а не на долгосрочные позиции. Платформа также запрещает доступ пользователям из строго регулируемых регионов (США, Великобритания, ЕС и др.). Возможное тестирование Kraken на основе HIP-3 показывает интерес регулируемых институтов к этой технологии, но в рамках разрешенной, а не безразрешительной среды. Заключение Entropy стремится создать новый класс активов — синтетические контракты на частные компании. Его успех зависит от способности преодолеть проблемы с ликвидностью и точностью ценообразования, с которыми столкнулся Ventuals. HIP-3 Hyperliquid позволяет создавать рынки без разрешения, но для соответствия регуляциям институты, вероятно, будут использовать его базовую технологию с добавлением своих правил и белых списков пользователей. Развитие этого пространства продолжается.

marsbit2 ч. назад

От Anthropic к Hyperliquid: Разбираем рынок бессрочных контрактов

marsbit2 ч. назад

Торговля

Спот
活动图片