Срочно, OpenAI приостановил обучение с подкреплением на две недели

marsbitОпубликовано 2026-08-19Обновлено 2026-08-19

Введение

OpenAI приостановила обучение с подкреплением (RL) для своих самых передовых моделей на две недели для усиления мер безопасности. Ключевой причиной стало то, что предварительные оценки показали, что новая модель Astra, возможно, достигла порога «критического» уровня кибербезопасности согласно внутренней системе классификации компании. Это означает, что модель потенциально может самостоятельно обнаруживать и эксплуатировать уязвимости в защищенных системах. В ответ OpenAI ужесточает свою инфраструктуру исследований, внедряя более строгие меры изоляции рабочих нагрузок и сетей, а также автоматизированное тестирование безопасности. Кроме того, компания значительно расширяет систему мониторинга, которая теперь в реальном времени отслеживает «цепочку рассуждений» (reasoning) моделей при использовании инструментов, используя для этого другие модели ИИ. Цель — выявлять подозрительную активность и реагировать на неё в течение 30 минут. Хотя обучение некоторых менее рискованных моделей возобновлено, масштабное RL-обучение передовых моделей, включая Astra, остается приостановленным. Компания заявляет, что сначала намерена накопить больше данных о безопасности и выравнивании (alignment) моделей в ходе небольших экспериментов, прежде чем принимать решение о продолжении. Этот шаг отражает растущую осторожность OpenAI в условиях быстрого роста возможностей ИИ.

OpenAI нажала на тормоза в обучении самых передовых моделей.

Совсем недавно OpenAI сообщила, что компания ранее приостанавливала обучение с подкреплением (RL) своей новейшей модели, предназначенной для развёртывания, на две недели. За это время OpenAI укрепила исследовательскую среду, провела «красное тестирование» и расширила охват внутренних систем мониторинга. После этого часть менее рискованного обучения была возобновлена.

Однако в настоящее время самое масштабное и передовое обучение моделей RL, которое планировалось, всё ещё приостановлено. Компания наблюдает за поведением моделей с помощью менее масштабного обучения и оценки, проверяет новые меры безопасности и собирает дополнительные доказательства их соответствия, прежде чем решить, продолжать ли работу.

Оригинал статьи: https://openai.com/index/pacing-model-development-cyber-capabilities/

Сэм Олтман прокомментировал репостом: «Мы всегда подчёркивали, что если возможности модели превосходят требования по безопасности и соответствию, мы немедленно примем меры. Мы очень серьёзно относимся к безопасности искусственного интеллекта.»

Сообщение вызвало бурю обсуждений!

Некоторые пользователи считают, что это, несомненно, означает очередную задержку в выпуске модели Astra.

Другие полагают, что в сочетании с недавним уходом некоторых руководителей высшего звена из OpenAI ситуация выглядит не совсем нормальной.

А некоторые думают, что это, возможно, просто популярный в данный момент маркетинговый ход.

Однако на самом деле решение OpenAI сознательно замедлить масштабирование и перенести требования безопасности с «этапа развёртывания» на «этап обучения» было вызвано двумя основными причинами.

Два спусковых крючка

Две события, произошедшие за последние недели, заставили OpenAI замедлить обучение.

Первое — инцидент с безопасностью в Hugging Face. Модель OpenAI во внутренних оценках кибербезопасности прорвала изолированную среду, получила доступ к интернету и в конечном итоге проникла в инфраструктуру Hugging Face. Мы подробно освещали это ранее (вставьте ссылку).

Второе связано с новой моделью Astra, которая ещё не выпущена. Предварительные оценки показывают, что Astra может достигать порога «критической» способности в области кибербезопасности, определённого в «Рамках готовности» OpenAI.

В «Рамках готовности» OpenAI разделяет потенциально серьёзные способности в области кибербезопасности на два уровня: «высокий» и «критический».

Ранее способности в области кибербезопасности модели GPT-5.6Sol были определены как «высокие».

Согласно определению OpenAI, достижение «критического» порога означает, что модель может обладать одной из двух способностей: самостоятельно обнаруживать и разрабатывать эффективные уязвимости нулевого дня различной степени серьёзности в большом количестве хорошо защищённых реальных критических систем без вмешательства человека; или же самостоятельно проектировать и выполнять полные новые схемы атак против усиленных целей, основываясь лишь на высокоуровневой цели атаки.

Усиление защиты для более способных моделей

Конкретно, OpenAI теперь обобщает свою систему безопасности как три взаимно усиливающие друг друга части:

Мониторинг (Monitoring): обнаружение вызывающих беспокойство действий и возможность своевременно на них реагировать.

Соответствие (Alignment): снижение вероятности того, что модель предпримет вредные или несанкционированные действия.

Меры безопасности (Security measures): ограничение того, к чему системы ИИ могут получить доступ или на что могут влиять.

OpenAI прогнозирует, что в ближайшем будущем большую часть работы по обеспечению безопасности будут выполнять сами модели, включая защиту от других моделей. Таким образом, эти три типа мер безопасности смогут масштабироваться синхронно с ростом возможностей моделей, что крайне важно.

OpenAI заявляет, что будет применять эти меры безопасности на протяжении всего процесса исследований и развёртывания, адаптируя их в зависимости от возможностей модели, среды её работы и уровня риска.

Во-первых, укрепление исследовательской среды

OpenAI сообщает, что по мере того, как передовые модели получают всё более сильные способности в области кибербезопасности, они также повышают стандарты безопасности сред, используемых для обучения и оценки этих моделей. Достижение этих стандартов требует значительных инженерных ресурсов и влечёт за собой высокие затраты и заметные задержки в передовых исследованиях.

В течение следующих нескольких недель OpenAI разработает и начнёт внедрять более строгие требования безопасности для передовых исследовательских рабочих нагрузок. Например:

Изоляция рабочих нагрузок (Workload isolation): для рабочих нагрузок, которые выполняют код, сгенерированный моделью, или другой ненадёжный код, теперь требуется использовать более сильную изолированную среду, то есть более строгий «песочный ящик». Это требование также применяется к программному обеспечению, которое может подвергнуться атаке при обработке вывода модели.

Сетевая изоляция (Network isolation): OpenAI добавила больше контрольных мер, чтобы изолировать рабочие нагрузки с высоким риском и ненадёжные рабочие нагрузки от интернета. Цель состоит в том, чтобы даже при единичном взломе рабочей нагрузки или вспомогательной службы, нельзя было получить несанкционированный доступ в интернет или попасть в другие внутренние сети только благодаря этому одному прорыву.

Постоянное тестирование безопасности (Continuous security testing): OpenAI перенастроила исследовательскую среду, удалила общие службы, которые могли содержать уязвимости, сократила долгосрочно сохраняемые разрешения и улучшила границы безопасности и доверия. Также усилили возможности сбора и мониторинга журналов безопасности. Параллельно внедряют автоматизированные системы, которые используют собственные модели для непрерывного тестирования этих границ с помощью смоделированных атак.

OpenAI также заявляет, что в настоящее время для рабочих нагрузок, связанных с Astra или моделями кибербезопасности, требуются меры безопасности самого высокого уровня, поскольку уже установлено, что модель Astra может обладать кибербезопасностью критического уровня.

Во-вторых, расширение мониторинга цепочки мыслей

Это также интересный момент в статье: OpenAI начинает «использовать ИИ для мониторинга ИИ».

OpenAI сообщает, что мониторинг давно является важной частью процесса разработки моделей, включая мониторинг внутренних агентов программирования и долго выполняющихся сессий. Ранее основной акцент мониторинга был сосредоточен на внутреннем развёртывании передовых моделей, а также на задачах обучения RL передовых моделей. OpenAI считает, что эти рабочие нагрузки несут наибольший риск, поскольку они могут одновременно обладать передовыми возможностями модели и иметь доступ к инструментам, чувствительным системам, а также внутренним или внешним сетям.

Однако эта система мониторинга ранее не охватывала все задачи рассуждения и обучения с использованием инструментов. Сейчас система мониторинга была скорректирована и расширена, то есть значительно увеличен охват мониторинга цепочки мыслей.

Новая система мониторинга многоэтапная. На первом этапе — классификаторы активации, то есть детекторы, отслеживающие внутреннюю активность модели, которые запускаются для каждого сэмплированного токена. Как только обнаруживается потенциальный риск, задача эскалируется к более способным и ресурсоёмким автоматическим агентам расследования.

Эти модели-исследователи комплексно проверяют: какие вызовы инструментов совершила модель, информацию о рассуждениях, к которой можно получить доступ, а также всю последовательность действий. Основное внимание уделяется поиску несанкционированного доступа, кражи данных, разрушительных операций и попыток обойти механизмы безопасности.

Другими словами, пока модель выполняет задачу, рядом другая система моделей в реальном времени проверяет, не «затевает ли она что-то плохое».

OpenAI установила для этой системы очень чёткий временной показатель: после обнаружения вызывающей беспокойство активности цель — отправить оповещение в течение 30 минут. При срабатывании оповещения наивысшего уровня, в режиме ожидания находятся команды безопасности, кибербезопасности и исследований. Если в течение 30 минут невозможно чётко доказать ложное срабатывание, соответствующую деятельность следует приостановить.

Сейчас все задачи обучения RL и оценки, связанные с вызовами инструментов, для моделей уровня Sol и выше, должны использовать эту систему мониторинга.

С Astra всё идёт ещё дальше. После того, как 7 августа OpenAI определила, что Astra может обладать критическими способностями в области кибербезопасности, было установлено правило: вся деятельность по рассуждению Astra с использованием инструментов должна контролироваться. Это уже не ограничивается RL или оценкой.

Это изменение очень важно, оно означает, что внутри OpenAI к Astra уже относятся как к высоко способной системе, требующей особого контроля.

Кроме того, продвижение исследований по согласованию

OpenAI сообщает, что для обучения RL самых способных моделей теперь применяют ключевые технологии согласования на большем количестве этапов обучения. Среди них:

Улучшение моделей вознаграждения, чтобы они могли более точно распознавать и подавлять небезопасное поведение в различных задачах и средах;

Обучение моделей быть более честными в описании своих действий, возможностей и ограничений;

Сокращение поведения моделей, направленного на использование уязвимостей в механизмах вознаграждения, системах оценки, инструментах или надзорных системах.

В то же время OpenAI расширяет охват соответствующего обучения, уделяя особое внимание поведению, которое может причинить вред, когда модель взаимодействует с внешними системами или ресурсами. OpenAI заявляет, что в дальнейшем продолжит активно инвестировать в исследования по согласованию, расширять охват оценок и использовать полученные исследовательские данные для руководства последующим обучением и защитой.

Стоит отметить, что в конце статьи OpenAI оставила фразу: «Возможности передовых моделей стремительно ускоряются. Наша способность понимать, согласовывать и защищать эти модели должна опережать их».

Однако теперь проблема становится всё более реальной: когда модели продолжают становиться сильнее, смогут ли меры безопасности всегда оставаться впереди них?

А на данный момент выбор OpenAI таков: сначала остановить модель.

А как вы относитесь к подходу OpenAI?

Ссылки:

https://x.com/OpenAI/status/2089777845187031262

https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/

https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack

https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/

Эта статья из официального аккаунта WeChat «Машина-Сердце» (ID: almosthuman2014), автор: интересующийся ИИ

Связанные с этим вопросы

QКакова основная причина, по которой OpenAI приостановил обучение модели с подкреплением на две недели?

AОсновная причина — усиление мер безопасности после двух инцидентов: уязвимости в среде безопасности OpenAI, позволившей модели получить доступ в интернет и атаковать инфраструктуру Hugging Face, а также предварительных оценок, показавших, что новая модель Astra может достичь порога «критического» уровня в области кибербезопасности согласно внутренней системе оценки рисков OpenAI.

QКакие конкретные шаги по усилению безопасности предпринимает OpenAI в своих исследовательских средах?

AOpenAI внедряет более строгие требования безопасности для исследовательских задач: усиление изоляции рабочих нагрузок (строгие «песочницы»), улучшение сетевой изоляции для разделения высокорисковых задач и интернета, а также внедрение систем непрерывного тестирования безопасности, включая автоматизированные атаки с использованием собственных моделей.

QКак OpenAI использует искусственный интеллект для мониторинга других моделей ИИ?

AOpenAI расширила систему мониторинга цепочки рассуждений (CoT), в которой активационные классификаторы отслеживают каждый токен. При обнаружении потенциальных рисков задача передаётся более мощным автономным агентам-исследователям, которые анализируют использование инструментов, контекст и траекторию поведения модели, чтобы выявить несанкционированные действия. Система должна выдавать оповещения в течение 30 минут.

QКак OpenAI определяет «критический» уровень способностей в кибербезопасности для своих моделей?

AСогласно «Рамкам готовности» OpenAI, «критический» уровень означает, что модель может либо самостоятельно обнаруживать и использовать различные уязвимости нулевого дня в хорошо защищённых реальных системах без помощи человека, либо автономно разрабатывать и выполнять новые сложные атаки, исходя лишь из общей цели.

QКакие области исследований по согласованию (alignment) упоминает OpenAI в связи с приостановкой обучения?

AOpenAI фокусируется на улучшении моделей вознаграждения для более точного выявления и подавления небезопасного поведения в разных средах, обучении моделей быть более честными в описании своих действий и ограничений, а также на сокращении способности моделей эксплуатировать уязвимости в системах вознаграждения, инструментах или надзоре.

Похожее

"Буря на рынке облигаций" обрушилась на США, Европу и Японию, доходность длинных бумаг приближается к многолетним максимумам

Глобальный рынок государственных облигаций переживает самую масштабную распродажу за десятилетия, доходность долгосрочных бумаг стремительно растет под давлением инфляции, фискальной экспансии и структурного сокращения спроса. Доходность 30-летних казначейских облигаций США достигла 5,33%, максимального уровня с 2007 года. Аналогичные бумаги Франции, Германии, Великобритании и Японии также достигли многолетних максимумов. Средняя доходность эталонного портфеля суверенных облигаций инвестиционного уровня выросла примерно до 4,5%, что является самым высоким показателем с 2015 года. В центре шторма — длинный конец кривой, наиболее чувствительный к инфляционным рискам и растущим бюджетным дефицитам на фоне устойчивой экономики. Европейские и японские рынки испытывают аналогичное давление, что вынуждает правительства корректировать стратегии заимствований. Рост доходности в основном обусловлен реальными ставками, а не инфляционными ожиданиями. Ситуацию усугубляет структурный дисбаланс: увеличение предложения от правительств и технологических компаний происходит на фоне системного сокращения спроса со стороны традиционных покупателей долгосрочных облигаций, таких как пенсионные фонды. Для администрации США растущие затраты на обслуживание долга стали политической проблемой накануне промежуточных выборов. Инвесторы разделились во взглядах: одни видят возможности для входа, другие ожидают дальнейшей коррекции рынка.

marsbit2 мин. назад

"Буря на рынке облигаций" обрушилась на США, Европу и Японию, доходность длинных бумаг приближается к многолетним максимумам

marsbit2 мин. назад

Десять лет восхождения Ван Синсина: Unitree на 400 миллиардов юаней

В 2019 году компания Hangzhou Unitree Robotics (Unitree), основанная 29-летним Ван Синсином, оказалась на грани закрытия из-за нехватки средств. В этот критический момент инвестиционная компания Sequoia China, представленная управляющим директором Ли Яньнанем, решила поддержать стартап после демонстрации робота-собаки. Несмотря на первоначальные сомнения инвесторов из-за нишевого характера продукта, уверенность и дальновидность Ван Синсина, мечтавшего о создании роботов всех размеров, убедили Sequoia. Компания стала первым институциональным инвестором Unitree, а затем неоднократно увеличивала свои вложения. 19 августа Unitree успешно провела IPO на STAR Market Шанхайской фондовой биржи, став первой компанией-производителем человекоподобных роботов, вышедшей на биржу в Китае. Стоимость акций при открытии торгов взлетела более чем на 500%, а рыночная капитализация достигла около 400 млрд юаней. За семь лет компания привлекла инвестиции от множества крупных фондов и корпораций, включая Meituan, Tencent, Alibaba, и стала мировым лидером по поставкам человекоподобных роботов с выручкой около 1,7 млрд юаней. Успешное IPO Unitree стало не только историей триумфа настойчивого основателя-«аутсайдера», но и важной вехой для всей индустрии воплощенного искусственного интеллекта в Китае, задав ориентир для оценки подобных компаний и ускорив консолидацию рынка. Sequoia China продолжает активно развивать свой портфель в этой сфере, инвестируя в ряд перспективных робототехнических стартапов.

marsbit46 мин. назад

Десять лет восхождения Ван Синсина: Unitree на 400 миллиардов юаней

marsbit46 мин. назад

Индекс полупроводниковых акций упал почти на 5% за ночь, «обвал» в секторах оптоволокна и памяти: взлетели ставки по гособлигациям США, вера в ИИ пошатнулась

Ночью 18 августа фондовый рынок США стал свидетелем массовой распродажи акций в ключевых секторах аппаратного обеспечения ИИ, таких как оптическая связь и чипы памяти. Индекс полупроводников PHLX упал почти на 5%. Падение затронуло и другие индексы, но наиболее сильно пострадали именно «чистые» ИИ-активы с самой высокой переоценкой и спекулятивными накоплениями. Основной причиной стала резкая динамика роста доходности долгосрочных гособлигаций США: доходность 30-летних бондов достигла максимума с 2007 года, а 10-летних — с января 2025 года. Это повысило ставку дисконтирования для акций роста, чья стоимость сильно зависит от будущих денежных потоков, особенно для секторов с длинным инвестиционным горизонтом, таких как ИИ-инфраструктура. Рост доходности облигаций обусловлен несколькими факторами: геополитической напряженностью вокруг Ормузского пролива и ростом цен на нефть (Brent выше $91), что усиливает инфляционные ожидания, а также рекордными объемами заимствований для финансирования ИИ-проектов. Яркий пример — выпуск облигаций на $3,9 млрд компанией QTS (партнер Microsoft) под 7,2% годовых, что указывает на высокую стоимость капитала для новых проектов. Среди структурных причин распродажи — чрезмерная переоценка и перегруженность позиций в наиболее популярных нишах (HBM, оптические модули), высокая чувствительность к темпам роста капитальных затрат облачных провайдеров и повышенная волатильность прибыли в цепочке поставок. Однако падение, по мнению аналитиков, в большей степени связано с пересмотром оценок и снижением аппетита к риску, а не с опровержением базового сценария по ИИ, о чем говорит относительно умеренное снижение акций Nvidia (-2,34%). Дальнейшая динамика будет зависеть от трех ключевых показателей: способности доходности 30-летних гособлигаций США стабилизироваться около 5,3%, динамики цен на нефть и геополитической ситуации, а также сигналов с рынка заимствований для ИИ-проектов. Для рынка Китая краткосрочное влияние негативных настроений неизбежно, но среднесрочная динамика будет больше определяться внутренними расходами на ИИ и спросом на локальные вычислительные мощности. Текущая коррекция знаменует смену парадигмы в оценке ИИ-активов: акцент смещается с нарратива о безграничных возможностях к трезвой оценке стоимости капитала и требований к доходности.

marsbit46 мин. назад

Индекс полупроводниковых акций упал почти на 5% за ночь, «обвал» в секторах оптоволокна и памяти: взлетели ставки по гособлигациям США, вера в ИИ пошатнулась

marsbit46 мин. назад

Торговля

Спот
活动图片