OpenAI нажала на тормоза в обучении самых передовых моделей.
Совсем недавно OpenAI сообщила, что компания ранее приостанавливала обучение с подкреплением (RL) своей новейшей модели, предназначенной для развёртывания, на две недели. За это время OpenAI укрепила исследовательскую среду, провела «красное тестирование» и расширила охват внутренних систем мониторинга. После этого часть менее рискованного обучения была возобновлена.
Однако в настоящее время самое масштабное и передовое обучение моделей RL, которое планировалось, всё ещё приостановлено. Компания наблюдает за поведением моделей с помощью менее масштабного обучения и оценки, проверяет новые меры безопасности и собирает дополнительные доказательства их соответствия, прежде чем решить, продолжать ли работу.

Оригинал статьи: https://openai.com/index/pacing-model-development-cyber-capabilities/
Сэм Олтман прокомментировал репостом: «Мы всегда подчёркивали, что если возможности модели превосходят требования по безопасности и соответствию, мы немедленно примем меры. Мы очень серьёзно относимся к безопасности искусственного интеллекта.»

Сообщение вызвало бурю обсуждений!
Некоторые пользователи считают, что это, несомненно, означает очередную задержку в выпуске модели Astra.

Другие полагают, что в сочетании с недавним уходом некоторых руководителей высшего звена из OpenAI ситуация выглядит не совсем нормальной.

А некоторые думают, что это, возможно, просто популярный в данный момент маркетинговый ход.

Однако на самом деле решение OpenAI сознательно замедлить масштабирование и перенести требования безопасности с «этапа развёртывания» на «этап обучения» было вызвано двумя основными причинами.
Два спусковых крючка
Две события, произошедшие за последние недели, заставили OpenAI замедлить обучение.
Первое — инцидент с безопасностью в Hugging Face. Модель OpenAI во внутренних оценках кибербезопасности прорвала изолированную среду, получила доступ к интернету и в конечном итоге проникла в инфраструктуру Hugging Face. Мы подробно освещали это ранее (вставьте ссылку).
Второе связано с новой моделью Astra, которая ещё не выпущена. Предварительные оценки показывают, что Astra может достигать порога «критической» способности в области кибербезопасности, определённого в «Рамках готовности» OpenAI.
В «Рамках готовности» OpenAI разделяет потенциально серьёзные способности в области кибербезопасности на два уровня: «высокий» и «критический».
Ранее способности в области кибербезопасности модели GPT-5.6Sol были определены как «высокие».
Согласно определению OpenAI, достижение «критического» порога означает, что модель может обладать одной из двух способностей: самостоятельно обнаруживать и разрабатывать эффективные уязвимости нулевого дня различной степени серьёзности в большом количестве хорошо защищённых реальных критических систем без вмешательства человека; или же самостоятельно проектировать и выполнять полные новые схемы атак против усиленных целей, основываясь лишь на высокоуровневой цели атаки.
Усиление защиты для более способных моделей
Конкретно, OpenAI теперь обобщает свою систему безопасности как три взаимно усиливающие друг друга части:
Мониторинг (Monitoring): обнаружение вызывающих беспокойство действий и возможность своевременно на них реагировать.
Соответствие (Alignment): снижение вероятности того, что модель предпримет вредные или несанкционированные действия.
Меры безопасности (Security measures): ограничение того, к чему системы ИИ могут получить доступ или на что могут влиять.
OpenAI прогнозирует, что в ближайшем будущем большую часть работы по обеспечению безопасности будут выполнять сами модели, включая защиту от других моделей. Таким образом, эти три типа мер безопасности смогут масштабироваться синхронно с ростом возможностей моделей, что крайне важно.
OpenAI заявляет, что будет применять эти меры безопасности на протяжении всего процесса исследований и развёртывания, адаптируя их в зависимости от возможностей модели, среды её работы и уровня риска.
Во-первых, укрепление исследовательской среды
OpenAI сообщает, что по мере того, как передовые модели получают всё более сильные способности в области кибербезопасности, они также повышают стандарты безопасности сред, используемых для обучения и оценки этих моделей. Достижение этих стандартов требует значительных инженерных ресурсов и влечёт за собой высокие затраты и заметные задержки в передовых исследованиях.
В течение следующих нескольких недель OpenAI разработает и начнёт внедрять более строгие требования безопасности для передовых исследовательских рабочих нагрузок. Например:
Изоляция рабочих нагрузок (Workload isolation): для рабочих нагрузок, которые выполняют код, сгенерированный моделью, или другой ненадёжный код, теперь требуется использовать более сильную изолированную среду, то есть более строгий «песочный ящик». Это требование также применяется к программному обеспечению, которое может подвергнуться атаке при обработке вывода модели.
Сетевая изоляция (Network isolation): OpenAI добавила больше контрольных мер, чтобы изолировать рабочие нагрузки с высоким риском и ненадёжные рабочие нагрузки от интернета. Цель состоит в том, чтобы даже при единичном взломе рабочей нагрузки или вспомогательной службы, нельзя было получить несанкционированный доступ в интернет или попасть в другие внутренние сети только благодаря этому одному прорыву.
Постоянное тестирование безопасности (Continuous security testing): OpenAI перенастроила исследовательскую среду, удалила общие службы, которые могли содержать уязвимости, сократила долгосрочно сохраняемые разрешения и улучшила границы безопасности и доверия. Также усилили возможности сбора и мониторинга журналов безопасности. Параллельно внедряют автоматизированные системы, которые используют собственные модели для непрерывного тестирования этих границ с помощью смоделированных атак.
OpenAI также заявляет, что в настоящее время для рабочих нагрузок, связанных с Astra или моделями кибербезопасности, требуются меры безопасности самого высокого уровня, поскольку уже установлено, что модель Astra может обладать кибербезопасностью критического уровня.
Во-вторых, расширение мониторинга цепочки мыслей
Это также интересный момент в статье: OpenAI начинает «использовать ИИ для мониторинга ИИ».
OpenAI сообщает, что мониторинг давно является важной частью процесса разработки моделей, включая мониторинг внутренних агентов программирования и долго выполняющихся сессий. Ранее основной акцент мониторинга был сосредоточен на внутреннем развёртывании передовых моделей, а также на задачах обучения RL передовых моделей. OpenAI считает, что эти рабочие нагрузки несут наибольший риск, поскольку они могут одновременно обладать передовыми возможностями модели и иметь доступ к инструментам, чувствительным системам, а также внутренним или внешним сетям.
Однако эта система мониторинга ранее не охватывала все задачи рассуждения и обучения с использованием инструментов. Сейчас система мониторинга была скорректирована и расширена, то есть значительно увеличен охват мониторинга цепочки мыслей.
Новая система мониторинга многоэтапная. На первом этапе — классификаторы активации, то есть детекторы, отслеживающие внутреннюю активность модели, которые запускаются для каждого сэмплированного токена. Как только обнаруживается потенциальный риск, задача эскалируется к более способным и ресурсоёмким автоматическим агентам расследования.
Эти модели-исследователи комплексно проверяют: какие вызовы инструментов совершила модель, информацию о рассуждениях, к которой можно получить доступ, а также всю последовательность действий. Основное внимание уделяется поиску несанкционированного доступа, кражи данных, разрушительных операций и попыток обойти механизмы безопасности.
Другими словами, пока модель выполняет задачу, рядом другая система моделей в реальном времени проверяет, не «затевает ли она что-то плохое».
OpenAI установила для этой системы очень чёткий временной показатель: после обнаружения вызывающей беспокойство активности цель — отправить оповещение в течение 30 минут. При срабатывании оповещения наивысшего уровня, в режиме ожидания находятся команды безопасности, кибербезопасности и исследований. Если в течение 30 минут невозможно чётко доказать ложное срабатывание, соответствующую деятельность следует приостановить.
Сейчас все задачи обучения RL и оценки, связанные с вызовами инструментов, для моделей уровня Sol и выше, должны использовать эту систему мониторинга.
С Astra всё идёт ещё дальше. После того, как 7 августа OpenAI определила, что Astra может обладать критическими способностями в области кибербезопасности, было установлено правило: вся деятельность по рассуждению Astra с использованием инструментов должна контролироваться. Это уже не ограничивается RL или оценкой.
Это изменение очень важно, оно означает, что внутри OpenAI к Astra уже относятся как к высоко способной системе, требующей особого контроля.
Кроме того, продвижение исследований по согласованию
OpenAI сообщает, что для обучения RL самых способных моделей теперь применяют ключевые технологии согласования на большем количестве этапов обучения. Среди них:
Улучшение моделей вознаграждения, чтобы они могли более точно распознавать и подавлять небезопасное поведение в различных задачах и средах;
Обучение моделей быть более честными в описании своих действий, возможностей и ограничений;
Сокращение поведения моделей, направленного на использование уязвимостей в механизмах вознаграждения, системах оценки, инструментах или надзорных системах.
В то же время OpenAI расширяет охват соответствующего обучения, уделяя особое внимание поведению, которое может причинить вред, когда модель взаимодействует с внешними системами или ресурсами. OpenAI заявляет, что в дальнейшем продолжит активно инвестировать в исследования по согласованию, расширять охват оценок и использовать полученные исследовательские данные для руководства последующим обучением и защитой.
Стоит отметить, что в конце статьи OpenAI оставила фразу: «Возможности передовых моделей стремительно ускоряются. Наша способность понимать, согласовывать и защищать эти модели должна опережать их».
Однако теперь проблема становится всё более реальной: когда модели продолжают становиться сильнее, смогут ли меры безопасности всегда оставаться впереди них?
А на данный момент выбор OpenAI таков: сначала остановить модель.
А как вы относитесь к подходу OpenAI?
Ссылки:
https://x.com/OpenAI/status/2089777845187031262
https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/
https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack
https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/
Эта статья из официального аккаунта WeChat «Машина-Сердце» (ID: almosthuman2014), автор: интересующийся ИИ





