720 атак, 0 успешных: Claude Code по умолчанию дает разрешения, ИИ нажимает «Согласен» за вас
Эра ручного подтверждения действий Claude Code подходит к концу. С 14 августа в новых сессиях планов Pro, Max и Team AI по умолчанию будет автоматически давать согласие на выполнение действий, вместо того чтобы запрашивать разрешение у пользователя для каждого шага.
Основатель Claude Code Борис Черны заявил, что команда месяцами использует этот «Авторежим» и не представляет возврата к постоянным всплывающим окнам. Его уверенность основана на тестах: третья сторона, Trajectory Labs, провела 720 атак по 72 различным сценариям против моделей Claude Fable 5, Opus 5 и Sonnet 5, и ни одна не увенчалась успехом.
Ключевое изменение заключается в том, что кнопку «Согласиться» теперь нажимает ИИ. Защита строится на трёх уровнях: 1) базовое обучение модели игнорировать вредоносные инструкции из внешних источников; 2) «зонд» на стороне ввода, анализирующий внешний контент; 3) классификатор действий на стороне вывода, проверяющий, санкционировано ли действие пользователем.
Хотя тесты показывают, что Авторежим перехватывает 89% опасных команд по сравнению с 13.6% у людей, эксперты в области безопасности, такие как Саймон Уиллсон, настроены скептически. Они указывают, что тестирование проводилось на ограниченном наборе сценариев и не является полностью независимым. Исследователи также выявили потенциальные слепые зоны, такие как команды в сторонних пакетах программ, которые могут обойти классификатор.
Таким образом, переход от «человека в цикле» к «классификатору в цикле» повышает эффективность, но представляет собой обмен рисками. Пользователь экономит клики, но делегирует право принятия решений ИИ, оставаясь при этом ответственным за последствия.
marsbit9 мин. назад