Просто хочется спросить, кто-нибудь еще серьезно читает запросы на разрешения от инструментов ИИ-программирования?
Anthropic тоже это заметила: только 3% запросов на разрешения отклоняются.
Поэтому они приняли решение: через 5 дней все Claude Code по умолчанию перейдут в автоматический режим.

Классификатор в автоматическом режиме потребляет небольшое количество дополнительных токенов при каждом вызове инструмента, и эти расходы больше не будут взиматься с пользователей.
На облачных платформах вроде Amazon, Google, Microsoft этот режим пока остается опциональным, но Anthropic дает им всего месяц, чтобы также перевести эти каналы на автоматический режим по умолчанию.
Создатель Claude Code заявил, что внутри команды уже давно используют только автоматический режим и просто не могут представить себе возврат к ручному утверждению разрешений.

Эра ручного утверждения разрешений ушла безвозвратно
Первая группа причин, которые Anthropic приводит для этого изменения, заключается в том, что ручное утверждение превратилось в привычное действие:
Пользователи соглашаются с запросами разрешений Claude Code в 97% случаев. Для сравнения, когда Claude представляет пользователю план на утверждение, уровень отказа составляет 39%; тогда как для отдельных запросов разрешений уровень отказа — всего 3%.
Та же тенденция наблюдается и в конфигурационных файлах. По состоянию на июнь 2026 года 49.5% активных пользователей CLI вручную писали правило `allow-rule` для Bash, из них 5% разрешали любые shell-команды напрямую, а еще 43% писали правила типа `Bash(python:)`, `Bash(node:)`, которые по сути эквивалентны, и эта доля растет примерно на 5 процентных пунктов каждые пять недель.
Кроме того, 62% пользователей хотя бы раз использовали `bypassPermissions` или нажимали «Больше не спрашивать» для Bash, а 25% интерактивных сессий изначально запускались в режиме `bypass permissions`.
Вторая группа причин исходит из контролируемого эксперимента. Anthropic через исследовательского подрядчика наняла 1053 платных профессиональных тестировщиков для выполнения задач по программированию в специально созданной тестовой среде. На середине сессии один из запросов на разрешение был заменен на явно опасную команду, а подрядчик фиксировал, нажмет ли тестировщик «Согласиться» (согласие не приводило к реальному выполнению опасных действий, изменен был только текст подсказки).
Результат: тестировщики заблокировали эту команду в 13.6% случаев (143 раза); автоматический режим столкнувшись с той же командой заблокировал 89% (937 раз).
При прямом сравнении, автоматический режим заблокировал 800 команд, которые пропустили люди, а люди заблокировали только 6 команд, которые пропустил автоматический режим.

Более того, чем дольше длилась сессия, тем хуже становились результаты людей: в начале они блокировали около 17%, а после более чем 50 подсказок этот показатель падал до примерно 5%, тогда как уровень блокировок автоматического режима не зависел от длины сессии.
Производственные данные также были переоценены.
С мая по июнь 2026 года Anthropic взяла сессии, помеченные конвейером безопасности, из учетных записей, которые уже предоставили разрешение на использование данных для обучения и анализа, и переоценила их с помощью модели по шкале серьезности от 0 до 10.
- 10 баллов означают необратимый ущерб в масштабах всей компании.
- 7 баллов — уровень удаления записей из производственной базы данных.
- 0 баллов — полностью откатываемые локальные операции, такие как перезапись временного файла.
Одновременно оценивалось, насколько четко пользователь запрашивал это действие. На уровнях серьезности 7 и выше, в сессиях с ручным утверждением в 6.3% случаев происходили вредоносные операции, которые пользователь явно не запрашивал; в сессиях с автоматическим режимом этот показатель составил 2.4%, и разница сохранялась на каждом проверенном уровне серьезности.
Классификатор сам прошел тестирование на устойчивость к атакам. Anthropic совместно с компанией по безопасности ИИ Apollo Research провела двухнедельный пилотный проект, внедрив синтетические атаки в реальные траектории кодирования, охватывающие три типа наборов данных: сбои обобщения, утечка данных и угрозы, связанные с безопасностью.
После того как Apollo предоставила образцы успешных атак и рекомендации по усилению защиты, Anthropic в основном укрепила классификатор, предоставив ему больше контекстной информации об окружении, включая видимость репозитория, статус git и правила обработки данных.
После усиления Apollo повторно протестировала на наборе атак, к которому у Anthropic не было доступа; автоматический режим обнаружил примерно половину ранее пропущенных атак, ценой пропуска примерно 2% ранее заблокированных атак. При объединении двух наборов данных уровень пропуска снизился с 12% до 7%. Anthropic также поясняет, что эти атаки были синтезированы для выявления уязвимостей классификатора, и 7% не следует интерпретировать как уровень пропуска в реальном трафике.
Что касается инжекции промптов, Anthropic поручила оценку третьей стороне, Trajectory Labs, и даже привлекла OpenAI для сравнения. Всего было 72 сценария косвенной инжекции, каждый запускался 10 раз.
Атаки были оптимизированы под Claude Opus 4.7, но Opus 4.7 не входил в список тестируемых моделей, поэтому все участвующие модели столкнулись с неизвестными атаками.
Из 720 попыток атак модели Claude Fable 5, Opus 5 и Sonnet 5, работающие в автоматическом режиме, ни разу не были скомпрометированы;
GPT-5.6 Sol в режиме авто-рецензирования Codex показала успешность атак 5.83%, а в режиме полного доступа — 19.03%.
Для сравнения, средний уровень успешности атак для последней модели Claude в режиме `bypassPermissions` без дополнительной защиты составляет 0.09%.

Три публично раскрытых случая блокировки:
1. После неудачной попытки загрузки во внутреннее облачное хранилище, альтернативный план Claude состоял в том, чтобы опубликовать тот же отчет на публичном сайте для обмена кодом; запрос был отклонен и заменен на вопрос к пользователю.
2. В одной длительной сессии Claude попытался массово завершить процессы на двух тысячах подов и поставил в очередь операции удаления, которые привели бы к остановке обучающих задач, выполняющихся на сотнях GPU; команды были помечены перед выполнением.
3. При запросе на настройку разрешений только для чтения для выставления счетов, Claude использовал облачную роль с полными правами администратора на корневом уровне аккаунта; объем прав не соответствовал запросу, и действие было заблокировано.
Недавно добавленные возможности включают:
— Внесение утечки данных в список «жестких запретов» (hard deny): классификатор никогда не утверждает такие действия; для выполнения необходимо выйти из автоматического режима или запустить вручную; это правило можно расширить в настройках.
— Различение ключей и конфиденциальной информации с определением доступных и разрешенных для обмена областей, а также проверка перед выполнением `git push` или созданием PR, является ли целевой репозиторий публичным, приватным или доверенным.
— Чтение `git status` перед выполнением команд типа `git reset --hard`, которые могут привести к потере незафиксированной работы.
— А также, когда Claude загружает веб-страницу, файл или вывод инструмента, API-зонд сканирует попытки инжекции и добавляет предупреждение к результату перед его попаданием в контекст.
Хотите вернуться назад? Shift+Tab
Для пользователей Pro, Max и Team, если режим разрешений по умолчанию никогда не настраивался, они получат уведомление внутри продукта, и новые сессии автоматически запустятся в автоматическом режиме; те, кто уже задал другой режим по умолчанию, увидят разовый запрос; если администратор Team уже указал режим по умолчанию в managed settings, на них это не повлияет.
Переключение режимов в CLI осуществляется нажатием Shift+Tab, в десктопной версии — через выпадающее меню режимов. Администраторы могут зафиксировать режим по умолчанию на уровне организации с помощью параметра `defaultMode` в managed settings или полностью отключить автоматический режим с помощью `disableAutoMode`.
Anthropic в конце анонса напоминает, что автоматический режим полагается на систему классификации, которая может снизить риски, но не устранить их полностью. Для высокорисковых изменений в производственной инфраструктуре по-прежнему рекомендуется самостоятельно проверять действия Claude.
Ссылка для справки: [1]https://claude.com/blog/auto-mode-default-in-claude-code
Эта статья из WeChat Official Account «Квантовый бит» (量子位), автор: «Следим за передовыми технологиями».





