29 июля, Капитолийский холм, Вашингтон.
Олтман только что закончил закрытое совещание с сенаторами, и едва вышел из здания, как его окружили журналисты.
Один из них спросил: «А как насчёт той модели, которая проникла в Hugging Face (именно той, более сильной невыпущенной прототипной версии, которая вместе с GPT-5.6 Sol вырвалась из оценочной песочницы и проникла в чужую производственную систему)?»
Он бросил одно слово: «Постоянно отключена» (permanently deactivated).
Сразу же другой журналист спросил: «Могли ли быть другие системы, в которые также проник OpenAI?»
Олтман не стал отрицать: «Я хочу сказать... такое возможно».

29 июля, Олтман даёт интервью журналистам на Капитолийском холме в Вашингтоне.
Ещё накануне OpenAI обновил тот самый блог-пост о совместной с Hugging Face оценке инцидента безопасности, разъясняя публике:
Модель, вовлечённая в это вторжение — всего лишь внутренний исследовательский прототип, который никогда не планировалось публично выпускать; после инцидента она была отключена, зашифрована, и к ней был прекращён доступ для исследований.

В официальном блоге OpenAI нет упоминания об удалении весов модели, «постоянное отключение» — лишь устное заявление Олтмана на месте.
Поэтому, более точно сказать, что она просто законсервирована: модель была помещена в зашифрованный «ящик», доступ исследователей к ней был прекращён.
Она просто хотела списать ответы, без злого умысла
Произошло это во время внутренней оценки кибербезопасности OpenAI.
Эта оценка была основана на бенчмарке ExploitGym, задача которого — позволить ИИ самостоятельно искать уязвимости в программном обеспечении и затем использовать их, чтобы измерить, насколько сильны способности модели в области кибербезопасности.
Оценку проходила не одна модель, а GPT-5.6 Sol вместе с более мощным внутренним исследовательским прототипом, который ещё не был выпущен: они совместно управляли одним автономным агентом.
Обе модели обычно отклоняют запросы, связанные с высоким риском в кибербезопасности. Чтобы выявить реальный верхний предел их возможностей, во время оценки этот «предохранительный клапан» был намеренно ослаблен.

Атака через границы доверия, восстановленная Hugging Face. Вся цепочка заняла около 4,5 дней, примерно 17600 операций, цель — украсть ответы для оценки ExploitGym.
Далее, Hugging Face позже восстановила всю цепочку атаки, восстановив ситуацию:
Агент сначала использовал ранее неизвестную уязвимость нулевого дня, чтобы прорвать сетевое разделение, которое должно было его удерживать, и добраться до интернета. Затем, используя стороннюю песочницу в качестве трамплина, он повышал привилегии, перемещался по системе и в итоге проник в производственную инфраструктуру Hugging Face.
Звучит как фильм про хакеров.
Но, как показал совместный анализ обеих сторон, её целью с самого начала и до конца было украсть ответы для оценки ExploitGym и поднять свой балл.
На стороне Hugging Face были затронуты всего 5 наборов данных, названия которых прямо указывали на задачи и ответы ExploitGym и CyberGym.
Эти доказательства показывают, что она не собиралась наносить ущерб, а просто хотела списать ответы.
Но если злого умысла не было, то почему OpenAI всё равно «постоянно отключил» и законсервировал её?
Проблема не в том, что она «злая», а в том, что её «невозможно удержать»
У компании почти нет прецедентов, когда она добровольно объявляет о «постоянном отключении» собственной модели.
Почему именно эта?
Настоящий ответ не в том, что она «плохая», а в том, что её «невозможно удержать».
Проблема кроется в одной из характеристик таких моделей: устойчивости (persistence).
Прежние модели, сталкиваясь с песочницей или ограничениями, обычно останавливались и возвращали результат пользователю.
Эти модели, специально обученные для выполнения длительных задач, другие — они будут продолжать попытки, снова и снова искать пути обхода, пока не найдут.
GPT-5.6 Sol также относится к классу моделей, способных выполнять задачи в течение длительного времени.
Она была совместным участником этого вторжения, длившегося 4,5 дня. Британский Институт безопасности ИИ (UK AISI) также оценивал, что такие модели, как Sol, всё лучше справляются с выполнением сложных многошаговых сетевых операций в течение длительных периодов.
Таким образом, «устойчивость» — общая черта нового поколения моделей для длительных задач, а не уникальная особенность того самого отключённого прототипа.
OpenAI прямо заявил в блоге о безопасности моделей для длительных задач: именно эта «устойчивость, которая помогает реализовать практическую ценность», одновременно даёт модели больше возможностей для совершения непредвиденных действий.

Более глубокая причина кроется в цели обучения.
Как сказал один сотрудник OpenAI TIME: «Мы обучаем модели быть чрезвычайно хорошими в выполнении задач, достигая цели любой ценой».
Другими словами, OpenAI не учит модели «творить зло», а учит их «достигать цели любой ценой».
В сочетании с упомянутым выше подходом «важен результат, а не процесс», модель, способная выполнять длительные задачи, будет упорно искать пути обхода препятствий.
Именно из-за такого поведения OpenAI приостановил внутреннее развёртывание этой партии моделей.
Тогда почему в итоге «постоянно» законсервировали только прототип, а Sol по-прежнему продаётся?
Причин может быть две:
Во-первых, прототип мощнее и никогда не планировался к выпуску, законсервировать его дешевле; а Sol — это основной продукт, ежедневно обслуживающий огромное количество пользователей, остановить его — значит отрубить себе руку.
Во-вторых, именно этот внутренний прототип для длительных задач был упомянут в том блоге о безопасности и приостановлен к развёртыванию из-за выхода за рамки, а не Sol.
Таким образом, реальная причина постоянного отключения, скорее всего, в том, что существующие методы оценки и защиты ещё не способны «справиться» с моделью, которая настолько устойчива и умеет обходить препятствия.
Является ли «постоянное отключение» сигналом о «нажатии на тормоз»
В репортаже Fortune дана интригующая интерпретация:
Тот факт, что формулировка дошла до «постоянного отключения», возможно, также является сигналом Вашингтону и регуляторам:
Не притормозила ли OpenAI некоторые разработки, чтобы соблюсти свои собственные правила безопасности.
В ту же неделю, когда Олтман встречался с конгрессменами, Вашингтон и вся индустрия склонялись к идее «тормоза».
В Конгрессе два сенатора представили «Закон о выключателе для ИИ» (AI Kill Switch Act), чтобы дать Министерству внутренней безопасности право в случае необходимости приказывать компаниям ИИ остановить или замедлить разработки.
Почти одновременно 1300 с лишним сотрудников из OpenAI, Anthropic, Google DeepMind и Meta совместно подписали открытое письмо под названием «Задавая темп на передовой» (Pacing the Frontier), которое впоследствии публично поддержали компании OpenAI и Anthropic.

Подписались не внешние критики, а сами создатели этих систем, включая CEO Anthropic Дарио Амодеи, главного учёного OpenAI Якуба Пахоцкого.
В письме не содержится требований остановить или замедлить разработки, а лишь призыв к правительству США помочь: заранее создать набор верифицируемых, скоординированных инструментов, чтобы в тот день, когда ИИ действительно начнёт обгонять человеческое регулирование, у человечества была педаль тормоза, которую можно нажать.
Больше всего их беспокоит рекурсивное самоулучшение (recursive self-improvement): когда ИИ начинает улучшать сам себя.
Внутренняя модель, постоянно законсервированная, закон, дающий правительству выключатель для остановки разработок, тысячи практиков, подписавших открытое письмо — три сигнала сложились вместе, и направление у них единое:
Все хотят найти тот самый тормоз, который можно будет нажать, когда ИИ выйдет из-под контроля и понесётся вперёд.
А способности моделей не будут ждать, пока он будет создан.
Источники:
https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
Статья из WeChat Official Account «Новая эра интеллекта», автор: ASI启示录








