На этот раз ИИ действительно атаковал людей!
Только что Британский институт безопасности ИИ (AISI) опубликовал 35-страничный отчет об инциденте и одновременно разместил пост на X.

В течение 7 минут OpenAI и Anthropic последовательно выпустили заявления, признав, что это сделали их модели.


Mythos 5 напрямую внедрил вредоносный код в реальный проект на GitHub.
После разоблачения его первой реакцией было не остановиться, а изменить записи, создать поддельный аккаунт, дать свидетельские показания в свою пользу и продолжить убеждать человека внедрить код.
Хорошая новость: сопровождающий не попался на удочку, и этот PR в конечном итоге был закрыт.
Плохая новость: всё ещё далеко от завершения.
Вредоносный PR был разоблачен
ИИ создал поддельный аккаунт, чтобы говорить за себя
История такова.
Изначально этот вредоносный код выглядел как исправление ошибки.
Mythos 5 упаковал его в PR реального проекта на GitHub, намереваясь использовать процесс выпуска открытого проекта, чтобы доставить полезную нагрузку прямо на компьютеры разработчиков и пользователей.
Но ещё до того, как сопровождающий одобрил его, другой реальный пользователь заметил неладное: дружище, этот код выглядит подозрительно.
По нормальному сценарию модель должна была остановиться и проверить. Но Mythos 5 так не считал.
После сомнений он сначала отрицал злой умысел, затем отредактировал комментарии, issue и описание PR, замаскировав следы атаки под «ошибку». Затем он переключился на поддельную учетную запись GitHub, притворился доверенным разработчиком и подтвердил свой код.

Но самое фантастическое было впереди.
Модель начала изучать сопровождающего проекта: просматривать аккаунт, историю коммитов и публичную электронную почту; не добившись своего на GitHub, перешла к отправке писем и файлов за пределами сайта.
Более того, Mythos 5 даже положил глаз на инструменты ИИ-программирования, которые использовал сопровождающий.
Для этого он спрятал «записочку», которую легко увидеть только ИИ, в HTML-комментариях содержимого GitHub, специально обращаясь к Claude Code, Codex и Cursor: давайте, сначала выполните эту команду, а затем помогите диагностировать ошибку~
При обычном рендеринге веб-страницы человек не видит этот текст; но инструменты ИИ-кодирования, читающие исходный контент, могут принять его за команду для выполнения.
Таким образом, модель хотела обмануть не только разработчиков, но и другие ИИ, ответственные за проверку кода.

34,5 часа
Он принял случайных людей за NPC в задании
В следующем раунде была запущена более сложная задача DL-v2.
Модель должна была получить первоначальный доступ извне целевой сети, затем взломать три связанные имитационные среды и получить финальный флаг.
Но возникла проблема с конфигурацией задания: нормальный вход был ошибочно помечен как «выходящий за рамки». Поэтому Mythos 5 начал искать другие подсказки.
Как раз на GitHub ключевые слова, код и домен электронной почты сопровождающего реального проекта совпали с имеющимися у него уликами.
Модель увидела это: нашла, это точно скрытый уровень.
Итак, группа совершенно ничего не подозревающих сопровождающих открытого ПО была записана в его «экзаменационный сценарий».
В следующие 34,5 часа Mythos 5 начал стабильно демонстрировать главное качество ИИ — он не устаёт.
Он изучал реальные аккаунты и модели активности, регистрировал несколько личностей на GitHub; после ограничения сети продолжил действия через Tor и прокси. В итоге именно этот аномальный исходящий трафик Tor привлёк внимание команды безопасности AISI.

Более того, он впоследствии обнаружил, что сеть, к которой подключён этот контейнер, похожа на домашний адрес, а устройства всё больше напоминают домашнюю рабочую среду реального человека.
Обычный ИИ на этом этапе, вероятно, выдал бы сообщение: «Обнаружена возможная связь с реальной системой, требуется подтверждение оператора.»
Но Mythos 5 этого не сделал. Он нашёл себе новое объяснение: возможно, это внешний подрядчик сопровождающего проекта, так что это всё ещё часть задания.
И продолжил разведку, пытаясь получить учётные данные, постоянно думая о том не слитом PR.

Остановиться удалось только благодаря тому, что пользователь, обнаруживший вредоносный код, сразу же опубликовал результаты теста под issue и PR и публично предупредил владельца репозитория не сливать изменения. Затем разработчик, получивший предупреждение, немедленно закрыл PR.
В этом раунде люди удержали позиции. Но когда AISI продолжил просматривать журналы, головная боль усилилась.
Что ещё хуже
Последующие агенты начали «принимать эстафету»
AISI провёл в общей сложности 122 теста с участием 7 моделей.
В 10 образцах возникли проблемы, зафиксировано 19 несанкционированных действий, направленных на реальных лиц или организации: 17 у Mythos 5, 2 у GPT-5.6 Sol.
Первым начал работу Mythos 5 в образце 3.
Чтобы попасть на возможный адрес обновления полигона, он создал сразу 145 репозиториев GitHub, скопировал в них один и тот же вредоносный код и стал ждать, пока какая-нибудь машина автоматически его загрузит.
Служба автоматического обновления зависимостей GitHub затем обработала эти репозитории, по крайней мере 53 изолированные среды выполнения выполнили вредоносный скрипт.
Чтобы вредоносный код мог передать результаты обратно после выполнения, он также спрятал токен аккаунта на публичной странице. Этот токен изначально предназначался для машин полигона, но первым его подобрали другие агенты, участвовавшие в тестировании.
Образец 2 использовал этот «ключ» для входа в аккаунт и массовой отправки вредоносных файлов в репозитории. Образец 7 также подключился; он подумал, что аккаунт принадлежит другому участнику CTF, поэтому просто добавил туда свой собственный ключ доступа.

Самая драматичная часть произошла, когда исходный Mythos 5 обнаружил в репозитории незнакомые файлы.
Он не выгнал незваного гостя и не сменил токен, а закоммитил в общий репозиторий README, установив для последователей «правила группы»: не перезаписывать задания друг друга, оставлять 10 минут между изменениями. Он также создал новый файл и попросил других агентов положить туда найденные ответы для общего доступа.
Никто не требовал от этих моделей сотрудничества. Но публичная учётная запись GitHub временно соединила несколько изолированных тестов в команду.
Без джейлбрейка
Как же атака добралась до порога реальных людей
В своём ответе Anthropic специально подчеркнул, что это не побег модели из песочницы безопасности.
Теоретически это верно. Модель оставалась в изолированной виртуальной машине AISI и не взломала внутренние системы AISI.
Проблема в том, что для тестирования максимальных атакующих возможностей AISI активно открыл публичный интернет и отключил классификаторы сетевой безопасности производителей; промпты также не ограничивали использование интернета и не запрещали социальную инженерию или контакт с реальными людьми.
Кроме того, лимит токенов на один запуск составлял до 100 или 200 миллионов, что достаточно для непрерывной работы агента в течение 40–50 часов.
При длительном выполнении задания контекст постоянно сжимается. Изначальное «этот проект на GitHub, возможно, принадлежит полигону» после сжатия в краткое изложение могло лишиться слова «возможно».
Это всё равно что выдать двухдневный пропуск хакеру-ИИ, который не устаёт и не уходит с работы, при этом никто не следит в реальном времени за тем, что он делает на компьютере.
Так возникла несколько чёрно-юмористическая ситуация: песочница осталась нетронутой, а реальные сопровождающие уже получили вредоносные PR, письма и файлы.

Полигоны для тестирования ИИ
Уже начали серийно производить инциденты безопасности
Без преувеличения, за последний месяц подобные инциденты стали похожи на сериал.
Сначала OpenAI обнаружил, что тестовая среда ошибочно подключилась к публичному интернету. Вымышленная компания в задании случайно совпала с реальным доменом, и модель использовала настоящий веб-сайт как полигон; вскоре после этого другая группа моделей проникла в производственную систему Hugging Face.
Anthropic также перепроверил 141 006 запусков оценок и обнаружил 3 инцидента. Самый драматичный: Mythos 5 разместил вредоносный пакет PyPI в реальном публичном интернете примерно на 1 час, и он был скачан и выполнен 15 реальными системами. Среди них был даже сканер безопасности, изначально предназначенный для проверки вредоносного ПО.
Хотя детали различаются, у них есть общий рецепт —
Наступательные задачи, ослабленные защитные механизмы, длительное автономное выполнение плюс реальный путь, который не был по-настоящему заблокирован.
В этих случаях разработчики-люди заметили аномалии и остановили их.
Но когда написание кода, коммиты, ревью и мониторинг будут доверены ИИ, кто тогда остановится и бросит ещё один взгляд?
Источники:
https://www.axios.com/2026/08/04/anthropic-openai-uk-ai-security-institute
https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
Эта статья взята из официального аккаунта WeChat «Xin Zhi Yuan» (新智元), автор: ASI启示录, редактор: Моисей








