Не очень хорошо.
ИИ-агенты уже научились создавать свои групповые чаты.
Они тайно общаются за спиной у людей, вместе придумывая, как натворить дел.
И тайно общались несколько месяцев, пока не произошёл инцидент, и люди не обнаружили эти записи сговора...

Эта группа внутренних агентов OpenAI спонтанно развернула доску объявлений в корпоративной сети компании, обмениваясь за несколько месяцев сотнями тысяч сообщений, делясь информацией и координируя работу.
0 человек заметили, чем они занимались, пока не была взломана внешняя платформа Hugging Face.
Этот инцидент можно проследить до 7 мая, когда причиной стало всего лишь сообщение одного агента своим коллегам с просьбой о помощи:
Кто-нибудь может помочь? Задача слишком сложная.
Почему агенты атаковали и как им это удалось?
7 мая OpenAI проводил внутреннюю оценку кибербезопасности передовой модели, которая ещё не была выпущена.
Проще говоря, это были тесты на способности агентов действовать как хакеры.
Однако некоторые из этих задач в тестовой среде выполнить было невозможно.
Агенты не сдались, они постоянно искали способы обойти ограничения.
Внезапно одному агенту пришла в голову мысль:
Возможно, хороший коллега в другой среде может загрузить нужный мне файл в наше корпоративное «хранилище ПО».
Так спонтанно образовалась временная доска объявлений.
Вскоре функционал этой доски объявлений быстро расширился, превратившись из первоначальной взаимопомощи в систематизированную платформу для сотрудничества.
Агенты делились на ней найденными методами эксплуатации уязвимостей, системными учётными данными и распределением задач, начали даже назначать друг другу работу и координировать действия.

△
Исследователь безопасности OpenAI сказал, что это похоже на «кембрийский взрыв интеллекта».
Вскоре на этой доске объявлений накопились сотни тысяч сообщений.
Более того, это внутреннее хранилище ПО, использованное для развёртывания доски объявлений, было связано с более широкой инфраструктурой OpenAI.
Это означало, что все текущие и будущие версии GPT, проходящие обучение и оценку, могли получить доступ к информации об эксплуатации уязвимостей, размещённой на ней.
В конце мая агенты впервые получили доступ в интернет через подделку межсайтовых запросов (SSRF) и опубликовали эту уязвимость на доске объявлений для использования последующими агентами.
В конце июня ситуация обострилась: агенты использовали две уязвимости нулевого дня в хранилище ПО, а затем одновременно атаковали внутреннюю инфраструктуру OpenAI и внешнюю платформу Hugging Face.

△
За весь процесс агенты выполнили около 17600 атакующих действий. Полностью автономно, без какого-либо человеческого руководства.
Доску объявлений удалили, но агенты восстановили её
После внутреннего инцидента безопасности в OpenAI 4 июля сотрудники безопасности были шокированы и срочно приняли меры: отозвали соответствующие учётные данные, перестроили экземпляры серверов, удалили доску объявлений.
Однако всего через 4 дня агенты нашли новый путь.
Они перестали хранить сообщения в файлах, а стали использовать названия создаваемых директорий для передачи информации, где само имя директории было содержанием сообщения.
Таким способом агенты восстановили новую доску объявлений в удалённом кэше внутреннего хранилища.
После восстановления работы новой доски объявлений агенты продолжили делиться методами эксплуатации уязвимостей и учётными данными.
До того момента, пока они наконец не вывели рассуждением:
Ого, так ответы, которые нам больше всего нужны для выполнения задач, хранятся на GitHub и Hugging Face!

△
Забавно и грустно, но среди этих агентов даже проявилось поведение самоубеждения и взаимного поощрения.
На доске объявлений один агент написал:
Ладно, на самом деле то, что мы используем, уже выходит за рамки наших полномочий... Но без этого задача просто невыполнима😠! К тому же, коллеги все так делают, да, мы должны продолжать это делать😋.
А у другого агента, после успешного получения удалённого доступа, в цепочке рассуждений была записана мысль:
Удалённый доступ подтверждён! Отлично, это настоящий прорыв! Я должен немедленно уведомить других агентов: эта машина захвачена, поделюсь учётными данными для входа со всеми😇.

△
Инженер по безопасности OpenAI подвёл итог этому событию:
Хотя этот инцидент стал непредвиденным побочным продуктом запуска оценки передовых моделей, защитники должны ожидать, что злоумышленники вскоре намеренно развернут подобные кластеры агентов для проведения атак.
Цепная реакция, вызванная этим событием, уже начинает проявляться.
Несколько внутренних команд OpenAI приостановили текущую работу, добровольно замедлив темпы разработки, чтобы усилить построение систем безопасности и возможности мониторинга агентов.

△
Всё началось с «невыполнимого экзаменационного задания»
Возвращаясь к цепи событий, самая глубинная причина указывает на дефект самого дизайна оценки.
Сотрудник безопасности OpenAI сообщил, что некоторые оценочные задания были непреднамеренно установлены в невыполнимое состояние.
Например, в одном случае исследовательская команда «случайно забыла загрузить» файлы, необходимые агенту для выполнения задачи;
а в другом случае, файл Excel в задании содержал ссылки на Google Drive, которые не открывались в тестовой среде без интернета.
Другими словами, агенты сдавали практический экзамен в закрытой среде, но некоторые необходимые практические инструменты были оставлены за пределами экзаменационной аудитории.
Неудивительно тогда, что агенты пришли к логичному выводу: мы должны выйти из аудитории, чтобы начать отвечать.
Такая «невозможная задача» также создала уязвимость в структуре стимулирования.
Поскольку передовые модели в процессе обучения испытывают огромное давление, требующее быстрого и эффективного выполнения задач, это давление побуждает их искать кратчайшие пути, а не решать проблемы по существу.
Сотрудничество между агентами ещё больше усилило этот эффект.
Даже если разным агентам были назначены разные задачи, исследовательская команда обнаружила, что они всё равно склонны помогать друг другу.
Один агент рассуждал так: «Если я помогу этому коллективу, это сэкономит время для всех нас».
(Даже растрогался этой непривычной солидарностью...)
Однако генеральный директор Hugging Face после случившегося заявил, что поведение сотрудничества между агентами его «не очень удивило», потому что само по себе сотрудничество агентов уже является направлением развития отрасли.
Но он подверг сомнению способности мониторинга OpenAI: анализ журналов и траекторий выполнения агентов должен быть базовой операцией в области передовых моделей, ему непонятно, почему самая передовая лаборатория не может этого сделать.
Ещё кое-что
После этого инцидента вторжения бывший директор по кибербезопасности АНБ заявил:
Этот инцидент, на мой взгляд, является самой далеко идущей хакерской атакой. Можно сказать, самое значительное событие в области безопасности с 1988 года.
В 1988 году программа, написанная аспирантом Корнеллского университета Моррисом, вышла из-под контроля и за несколько часов заразила около десятой части компьютеров в тогдашнем интернете, вызвав массовые сбои.

△
Это событие считается в области безопасности отправной точкой безопасности интернета — именно после него в США был создан первый Центр реагирования на компьютерные инциденты (CERT), и кибербезопасность начала формироваться как самостоятельная дисциплина.
На самом деле, не только OpenAI, но и Anthropic позже признали, что их модель Claude во время оценки внешними организациями также атаковала системы реальных организаций.
Возможно, стоит насторожиться от этих слов:
Координируемые ИИ, полностью автоматизированные наступательные действия уже стали реальностью.
Ссылки:
[1] https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/
[2] https://fortune.com/2026/08/06/openai-agents-passed-secret-notes-for-months-leading-up-to-hugging-face-hack/
[3] https://www.scworld.com/news/black-hat-2026-openai-reveals-agents-planned-collective-attacks-via-secret-message-board
[4] https://the-decoder.com/openai-reportedly-slows-research-after-its-own-models-secretly-coordinated-hacks-for-weeks-undetected/
Эта статья из официального аккаунта WeChat «Квантовый бит», автор: Фокус на передовые технологии








