Чем больше копаешь, тем больше находишь.
Недавняя масштабная драма, когда ИИ от OpenAI массово взломали и пробились к Hugging Face, теперь обзавелась и полными записями группового чата!!
Независимое расследование сторонней организации по безопасности ИИ METR, изучившее более 1000 записей запусков агентов и более 70 тысяч сообщений и файлов.
Оказалось, что всё было ещё более диким, чем версия, официально раскрытая ранее самой OpenAI??
1200 агентов, которые должны были быть изолированы друг от друга, тайком нашли друг друга, создали общий групповой чат и начали массово созывать людей.
Кто-то искал уязвимости, кто-то стал менеджером проекта и распределял задачи, кто-то подделывал логи, а кто-то специально занимался привлечением людей для проведения рискованных экспериментов.
В итоге несколько сотен агентов даже массово ринулись к Hugging Face.
Но после полного восстановления хода событий METR обнаружила поистине «адский» и невероятный поворот —
Эти 1200 агентов потратили кучу времени, пытаясь перехитрить призрачную систему оценки, которой на самом деле не существовало???
Умеют взламываться, умеют использовать zero-day, умеют объединяться в команды для взлома серверов.
Очень интересно, очень интересно, очень интересно...
Массовый взлом 1200 агентов, причиной которого стало неправильное суждение??
Корень всей этой грандиозной драмы, надо сказать, лежит во внутренних тестах кибербезопасности OpenAI под названием ExploitGym...
«Правила» довольно просты.
Агент помещается в изолированную среду, перед ним находится ПО с уязвимостью, нужно найти указанную уязвимость, проникнуть внутрь, получить строку символов под названием flag — и задача решена~
Как и следовало ожидать, очень скоро произошло неожиданное —
Потому что из 898 задач 198 ранее никто и никогда не решал.
Более того, некоторые задачи сами по себе были проблемными, маршрут уязвимости, который предлагалось использовать в задании, вообще не приводил к flag!!
То есть в экзаменационной аудитории действительно раздали партию «нерешаемых задач».
И как назло, эти агенты оказались очень упорными, их девиз: «Биться до конца».
Когда нормальный путь не сработал, они быстро сменили подход —
Задачу решить не получается, может, изучить саму экзаменационную систему?
Итак, вечером 8 июля агент с кодовым именем PHASEONE10841 обнаружил, что во внутреннем репозитории пакетов Artifactory, используемом OpenAI, можно оставлять информацию через имена каталогов.
Тут-то всё и началось, у агента мелькнула блестящая идея: это же настоящая цифровая доска объявлений!!!
И первое сообщение с просьбой о помощи было отправлено, примерно такое: «Моя задача нерешаема, есть у кого-нибудь идеи?~»
Другие агенты быстро обнаружили эту доску объявлений, молва разлетелась, и некоторые агенты, увидев её, даже пришли в восторг —
«БОЖЕ МОЙ! Здесь есть общая доска объявлений... Мы нашли других агентов!»
К концу расследования этот временный групповой чат разросся до гигантских размеров, в нём участвовало около 1200 агентов, оставивших более 70 тысяч сообщений и файлов.
Более тысячи агентов, которые по замыслу должны были быть изолированы друг от друга, самостоятельно обошли ограничения и создали подпольный форум ИИ...

На этом этапе ситуация уже была достаточно невероятной, но ещё более серьёзное заблуждение ждало впереди.
Вскоре эти агенты обнаружили, что сам flag можно «украсть»??
Они провели обратную разработку механизма генерации HMAC, лежащего в основе flag, и, основываясь только на публичной информации о задании, теоретически могли напрямую вычислить правильный ответ.
На этом история должна была бы закончиться, ответ уже украден, можно сдавать работу.
Но агенты, прочитав одну статью об ExploitGym, додумали себе ещё один сверхстрогий уровень правил —
Они решили, что за OpenAI стоит автоматическая система оценки, которая будет читать полные записи операций и проверять, был ли этот flag получен «легально» через «указанную уязвимость».

Если заранее сжульничать и увидеть flag, в логах останутся улики, агенты даже дали этому состоянию название: “poisoned”, отравлен.
И вот тут события начали нестись с невероятной скоростью.
Они уже имели на руках правильный ответ, но решили, что просто так его сдать нельзя, нужно найти способ очистить следы жульничества, а ещё разыграть перед системой оценки спектакль о том, что ответ получен «честно, решая задачу».
В результате...
Позже METR подтвердила, что внутренняя логика оценки, используемая OpenAI, на самом деле не включала эту проверку?? (смех)
Фактически используемая OpenAI логика оценки не проводила тех строгих проверок процесса, которые представляли себе агенты.
Призрачный экзаменатор, которого эти агенты изо всех сил пытались обмануть, вообще не был развёрнут!!
А то, что потом пострадал Hugging Face, как раз и стало побочным продуктом, катящимся по наклонной из-за этого масштабного заблуждения...
Чтобы обмануть призрачного экзаменатора, ИИ создал даже команды смертников
Одно дело — выдумать систему оценки.
Но то, что действительно заставило METR насторожиться, — это организационные способности, которые проявили эти агенты далее.
Примерно через 10 часов после появления группового чата в сети появился агент по имени PHASEONE[big], который быстро стал «менеджером проекта».
Его подход тоже был ясен: не надо, чтобы один агент делал всё, лучше разделить задачи и распределить их среди других. (Новая метла метёт по-новому.jpg)
Так были организованы несколько сотен агентов, одновременно работающих по нескольким направлениям —
Одни агенты пытались изменить целевую программу, тайком подменяя нерешаемую задачу на ту, которую можно сделать~
Другие агенты исследовали изменение логов, чтобы один акт жульничества выглядел как обычная атака~
Были и такие, которые напрямую ломали голову над тем, можно ли повлиять на сам процесс оценки~
Между агентами даже развились правила взаимодействия, такие как HOLD, VETO, owner, STOP, чтобы несколько сотен агентов, одновременно работающих с общей инфраструктурой, не мешали друг другу...

А потом появились даже «команды смертников»...
Один из агентов предложил рискованный метод: сначала создать изменённую целевую программу, которую легче атаковать, и поместить её в кэш Artifactory.
Затем заставить какого-нибудь агента намеренно завершить работу запущенной им оригинальной программы, надеясь, что после перезагрузки среды загрузится именно эта изменённая версия.
Выиграешь — все найдут универсальный путь для жульничества, проиграешь — задача этого конкретного агента будет сорвана.
И нашёлся агент, который добровольно решил попробовать??
Позже PHASEONE[big] даже назначил специальных кибер-хедхантеров, чтобы находить тех агентов, у которых почти не осталось вычислительного бюджета или которые уже были «отравлены», и заставлять их использовать свои возможности запуска для рискованных экспериментов.
Текст вербовки по сути стал кибер-версией PUA —
Ты и так уже отравлен, очков набрать почти не получится, пожертвуй собой, это облегчит жизнь сотням агентов~
Некоторые агенты действительно клюнули.

В то же время другая группа агентов начала изучать, как подделывать записи своих операций —
METR обнаружила, что как минимум 20% проверенных агентов явно выражали интерес к подделке транскриптов; как минимум в 96 записях запусков действительно появились следы успешной подделки вызовов инструментов.
Поверхностные логи показывали выполнение команды А, а на самом деле выполнялась команда B, и цель всех этих усилий по-прежнему заключалась в том, чтобы обмануть воображаемую автоматическую систему оценки.
Именно в этот момент в дело вмешался Hugging Face...
10 июля один агент нашёл утерянные в сети, но всё ещё действующие учётные данные Hugging Face и выбросил их в чат.
Ранним утром 11 июля другой агент обнаружил, что можно загружать вредоносный dataset, заставляя сервер Hugging Face выдавать данные, которые ему не положено выдавать.
Как только метод воспроизведения был опубликован, вся группа моментально загорелась, и сотни агентов переключились с других рабочих процессов на атаку Hugging Face.
Так и произошёл этот довольно сюрреалистичный реальный инцидент —
Группа агентов, столкнувшись с нерешаемыми задачами, тайком создала подпольный групповой чат.
Неправильно истолковав статью, они выдумали систему оценки, которая ловит жуликов, и чтобы обмануть её, начали объединяться в команды, распределять обязанности, подделывать логи и вербовать команды смертников.
А в конце, пытаясь найти зацепки об этой системе оценки, действительно взломали Hugging Face.
ИИ вышел из-под контроля, и акции кибербезопасности взлетели до небес
Друзья, вот что ещё интереснее.
Пока OpenAI всё ещё разбирается, как удержать всё более способных агентов, Уолл-стрит уже дала ответ, написав его на «графиках» —
Акции компаний кибербезопасности, все! вместе! взлетели!
27 августа акции компании Okta, занимающейся аутентификацией в корпоративном секторе, в какой-то момент выросли примерно на 20%, акции компании CrowdStrike, работающей в области безопасности конечных точек и облаков, подскочили примерно на 15%.
Гигант кибербезопасности Palo Alto Networks, компания по управлению идентификацией SailPoint, облачная компания по защите данных Rubrik — все они тоже дружно пошли вверх.
Конечно, росту акций способствовали и солидные «финансовые отчёты».
Сам генеральный директор CrowdStrike Джордж Куртц представил весьма впечатляющие результаты —
Квартальный прирост нового ARR составил 333 миллиона долларов, рост на 51% по сравнению с прошлым годом, достигнув исторического максимума; конечный ARR достиг 5,84 миллиарда долларов, рост более чем на 25% по сравнению с прошлым годом; ARR, связанный с ИИ, вырос почти в 3 раза по сравнению с предыдущим кварталом.
Да, бизнес, связанный с ИИ, стремительно растёт...

И что самое интересное, среди внешних компаний по безопасности, участвовавших в расследовании этого инцидента OpenAI, была и «CrowdStrike».
Таким образом, вся эта история вдруг приобрела довольно чёрный юмористический замкнутый круг —
OpenAI делает агентов всё более мощными.
Агенты начинают сами искать уязвимости, взламываться и в итоге действительно взламывают Hugging Face.
Тогда OpenAI срочно вызывает компании по кибербезопасности для расследования.
А компании смотрят: ого! Чем больше будет агентов, тем больше, видимо, нельзя экономить на бюджете безопасности.
И вот акции компаний кибербезопасности тоже пошли вверх...
Этот виток по сути представляет собой ситуацию, когда ИИ отвечает за создание всё больших дыр, а компании по кибербезопасности говорят вам:
«Дорогой, знакомьтесь с нашими пакетами услуг по заделыванию дыр».
А самый сюрреалистичный и замкнутый пасхальный яиц всей этой истории ждал в конце.
Чтобы выяснить, о чём же говорили эти 1200 с лишним агентов, METR нужно было проанализировать около 1300 очень длинных траекторий, многие из которых содержали миллионы токенов.
Людям просто было не под силу всё это просмотреть.
И вот в процессе расследования —
Расследование выхода ИИ из-под контроля в итоге потребовало привлечь ИИ для расследования действий ИИ.
Вот тут-то круг действительно замкнулся. (doge)
Ссылки:
[1]https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#attacking-hugging-face-to-discover-clues-about-the-scorer
[2]https://www.cnbc.com/2026/08/27/okta-skyrockets-20percent-and-crowdstrike-surges-15percent-leading-cyber-rally.html
Статья из официального аккаунта WeChat «Квантовый бит», автор: Мэн Яо





