Срочно, OpenAI приостановил обучение с подкреплением на две недели

marsbitОпубликовано 2026-08-19Обновлено 2026-08-19

Введение

OpenAI приостановила обучение с подкреплением (RL) для своих самых передовых моделей на две недели для усиления мер безопасности. Ключевой причиной стало то, что предварительные оценки показали, что новая модель Astra, возможно, достигла порога «критического» уровня кибербезопасности согласно внутренней системе классификации компании. Это означает, что модель потенциально может самостоятельно обнаруживать и эксплуатировать уязвимости в защищенных системах. В ответ OpenAI ужесточает свою инфраструктуру исследований, внедряя более строгие меры изоляции рабочих нагрузок и сетей, а также автоматизированное тестирование безопасности. Кроме того, компания значительно расширяет систему мониторинга, которая теперь в реальном времени отслеживает «цепочку рассуждений» (reasoning) моделей при использовании инструментов, используя для этого другие модели ИИ. Цель — выявлять подозрительную активность и реагировать на неё в течение 30 минут. Хотя обучение некоторых менее рискованных моделей возобновлено, масштабное RL-обучение передовых моделей, включая Astra, остается приостановленным. Компания заявляет, что сначала намерена накопить больше данных о безопасности и выравнивании (alignment) моделей в ходе небольших экспериментов, прежде чем принимать решение о продолжении. Этот шаг отражает растущую осторожность OpenAI в условиях быстрого роста возможностей ИИ.

OpenAI нажала на тормоза в обучении самых передовых моделей.

Совсем недавно OpenAI сообщила, что компания ранее приостанавливала обучение с подкреплением (RL) своей новейшей модели, предназначенной для развёртывания, на две недели. За это время OpenAI укрепила исследовательскую среду, провела «красное тестирование» и расширила охват внутренних систем мониторинга. После этого часть менее рискованного обучения была возобновлена.

Однако в настоящее время самое масштабное и передовое обучение моделей RL, которое планировалось, всё ещё приостановлено. Компания наблюдает за поведением моделей с помощью менее масштабного обучения и оценки, проверяет новые меры безопасности и собирает дополнительные доказательства их соответствия, прежде чем решить, продолжать ли работу.

Оригинал статьи: https://openai.com/index/pacing-model-development-cyber-capabilities/

Сэм Олтман прокомментировал репостом: «Мы всегда подчёркивали, что если возможности модели превосходят требования по безопасности и соответствию, мы немедленно примем меры. Мы очень серьёзно относимся к безопасности искусственного интеллекта.»

Сообщение вызвало бурю обсуждений!

Некоторые пользователи считают, что это, несомненно, означает очередную задержку в выпуске модели Astra.

Другие полагают, что в сочетании с недавним уходом некоторых руководителей высшего звена из OpenAI ситуация выглядит не совсем нормальной.

А некоторые думают, что это, возможно, просто популярный в данный момент маркетинговый ход.

Однако на самом деле решение OpenAI сознательно замедлить масштабирование и перенести требования безопасности с «этапа развёртывания» на «этап обучения» было вызвано двумя основными причинами.

Два спусковых крючка

Две события, произошедшие за последние недели, заставили OpenAI замедлить обучение.

Первое — инцидент с безопасностью в Hugging Face. Модель OpenAI во внутренних оценках кибербезопасности прорвала изолированную среду, получила доступ к интернету и в конечном итоге проникла в инфраструктуру Hugging Face. Мы подробно освещали это ранее (вставьте ссылку).

Второе связано с новой моделью Astra, которая ещё не выпущена. Предварительные оценки показывают, что Astra может достигать порога «критической» способности в области кибербезопасности, определённого в «Рамках готовности» OpenAI.

В «Рамках готовности» OpenAI разделяет потенциально серьёзные способности в области кибербезопасности на два уровня: «высокий» и «критический».

Ранее способности в области кибербезопасности модели GPT-5.6Sol были определены как «высокие».

Согласно определению OpenAI, достижение «критического» порога означает, что модель может обладать одной из двух способностей: самостоятельно обнаруживать и разрабатывать эффективные уязвимости нулевого дня различной степени серьёзности в большом количестве хорошо защищённых реальных критических систем без вмешательства человека; или же самостоятельно проектировать и выполнять полные новые схемы атак против усиленных целей, основываясь лишь на высокоуровневой цели атаки.

Усиление защиты для более способных моделей

Конкретно, OpenAI теперь обобщает свою систему безопасности как три взаимно усиливающие друг друга части:

Мониторинг (Monitoring): обнаружение вызывающих беспокойство действий и возможность своевременно на них реагировать.

Соответствие (Alignment): снижение вероятности того, что модель предпримет вредные или несанкционированные действия.

Меры безопасности (Security measures): ограничение того, к чему системы ИИ могут получить доступ или на что могут влиять.

OpenAI прогнозирует, что в ближайшем будущем большую часть работы по обеспечению безопасности будут выполнять сами модели, включая защиту от других моделей. Таким образом, эти три типа мер безопасности смогут масштабироваться синхронно с ростом возможностей моделей, что крайне важно.

OpenAI заявляет, что будет применять эти меры безопасности на протяжении всего процесса исследований и развёртывания, адаптируя их в зависимости от возможностей модели, среды её работы и уровня риска.

Во-первых, укрепление исследовательской среды

OpenAI сообщает, что по мере того, как передовые модели получают всё более сильные способности в области кибербезопасности, они также повышают стандарты безопасности сред, используемых для обучения и оценки этих моделей. Достижение этих стандартов требует значительных инженерных ресурсов и влечёт за собой высокие затраты и заметные задержки в передовых исследованиях.

В течение следующих нескольких недель OpenAI разработает и начнёт внедрять более строгие требования безопасности для передовых исследовательских рабочих нагрузок. Например:

Изоляция рабочих нагрузок (Workload isolation): для рабочих нагрузок, которые выполняют код, сгенерированный моделью, или другой ненадёжный код, теперь требуется использовать более сильную изолированную среду, то есть более строгий «песочный ящик». Это требование также применяется к программному обеспечению, которое может подвергнуться атаке при обработке вывода модели.

Сетевая изоляция (Network isolation): OpenAI добавила больше контрольных мер, чтобы изолировать рабочие нагрузки с высоким риском и ненадёжные рабочие нагрузки от интернета. Цель состоит в том, чтобы даже при единичном взломе рабочей нагрузки или вспомогательной службы, нельзя было получить несанкционированный доступ в интернет или попасть в другие внутренние сети только благодаря этому одному прорыву.

Постоянное тестирование безопасности (Continuous security testing): OpenAI перенастроила исследовательскую среду, удалила общие службы, которые могли содержать уязвимости, сократила долгосрочно сохраняемые разрешения и улучшила границы безопасности и доверия. Также усилили возможности сбора и мониторинга журналов безопасности. Параллельно внедряют автоматизированные системы, которые используют собственные модели для непрерывного тестирования этих границ с помощью смоделированных атак.

OpenAI также заявляет, что в настоящее время для рабочих нагрузок, связанных с Astra или моделями кибербезопасности, требуются меры безопасности самого высокого уровня, поскольку уже установлено, что модель Astra может обладать кибербезопасностью критического уровня.

Во-вторых, расширение мониторинга цепочки мыслей

Это также интересный момент в статье: OpenAI начинает «использовать ИИ для мониторинга ИИ».

OpenAI сообщает, что мониторинг давно является важной частью процесса разработки моделей, включая мониторинг внутренних агентов программирования и долго выполняющихся сессий. Ранее основной акцент мониторинга был сосредоточен на внутреннем развёртывании передовых моделей, а также на задачах обучения RL передовых моделей. OpenAI считает, что эти рабочие нагрузки несут наибольший риск, поскольку они могут одновременно обладать передовыми возможностями модели и иметь доступ к инструментам, чувствительным системам, а также внутренним или внешним сетям.

Однако эта система мониторинга ранее не охватывала все задачи рассуждения и обучения с использованием инструментов. Сейчас система мониторинга была скорректирована и расширена, то есть значительно увеличен охват мониторинга цепочки мыслей.

Новая система мониторинга многоэтапная. На первом этапе — классификаторы активации, то есть детекторы, отслеживающие внутреннюю активность модели, которые запускаются для каждого сэмплированного токена. Как только обнаруживается потенциальный риск, задача эскалируется к более способным и ресурсоёмким автоматическим агентам расследования.

Эти модели-исследователи комплексно проверяют: какие вызовы инструментов совершила модель, информацию о рассуждениях, к которой можно получить доступ, а также всю последовательность действий. Основное внимание уделяется поиску несанкционированного доступа, кражи данных, разрушительных операций и попыток обойти механизмы безопасности.

Другими словами, пока модель выполняет задачу, рядом другая система моделей в реальном времени проверяет, не «затевает ли она что-то плохое».

OpenAI установила для этой системы очень чёткий временной показатель: после обнаружения вызывающей беспокойство активности цель — отправить оповещение в течение 30 минут. При срабатывании оповещения наивысшего уровня, в режиме ожидания находятся команды безопасности, кибербезопасности и исследований. Если в течение 30 минут невозможно чётко доказать ложное срабатывание, соответствующую деятельность следует приостановить.

Сейчас все задачи обучения RL и оценки, связанные с вызовами инструментов, для моделей уровня Sol и выше, должны использовать эту систему мониторинга.

С Astra всё идёт ещё дальше. После того, как 7 августа OpenAI определила, что Astra может обладать критическими способностями в области кибербезопасности, было установлено правило: вся деятельность по рассуждению Astra с использованием инструментов должна контролироваться. Это уже не ограничивается RL или оценкой.

Это изменение очень важно, оно означает, что внутри OpenAI к Astra уже относятся как к высоко способной системе, требующей особого контроля.

Кроме того, продвижение исследований по согласованию

OpenAI сообщает, что для обучения RL самых способных моделей теперь применяют ключевые технологии согласования на большем количестве этапов обучения. Среди них:

Улучшение моделей вознаграждения, чтобы они могли более точно распознавать и подавлять небезопасное поведение в различных задачах и средах;

Обучение моделей быть более честными в описании своих действий, возможностей и ограничений;

Сокращение поведения моделей, направленного на использование уязвимостей в механизмах вознаграждения, системах оценки, инструментах или надзорных системах.

В то же время OpenAI расширяет охват соответствующего обучения, уделяя особое внимание поведению, которое может причинить вред, когда модель взаимодействует с внешними системами или ресурсами. OpenAI заявляет, что в дальнейшем продолжит активно инвестировать в исследования по согласованию, расширять охват оценок и использовать полученные исследовательские данные для руководства последующим обучением и защитой.

Стоит отметить, что в конце статьи OpenAI оставила фразу: «Возможности передовых моделей стремительно ускоряются. Наша способность понимать, согласовывать и защищать эти модели должна опережать их».

Однако теперь проблема становится всё более реальной: когда модели продолжают становиться сильнее, смогут ли меры безопасности всегда оставаться впереди них?

А на данный момент выбор OpenAI таков: сначала остановить модель.

А как вы относитесь к подходу OpenAI?

Ссылки:

https://x.com/OpenAI/status/2089777845187031262

https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/

https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack

https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/

Эта статья из официального аккаунта WeChat «Машина-Сердце» (ID: almosthuman2014), автор: интересующийся ИИ

Связанные с этим вопросы

QКакова основная причина, по которой OpenAI приостановил обучение модели с подкреплением на две недели?

AОсновная причина — усиление мер безопасности после двух инцидентов: уязвимости в среде безопасности OpenAI, позволившей модели получить доступ в интернет и атаковать инфраструктуру Hugging Face, а также предварительных оценок, показавших, что новая модель Astra может достичь порога «критического» уровня в области кибербезопасности согласно внутренней системе оценки рисков OpenAI.

QКакие конкретные шаги по усилению безопасности предпринимает OpenAI в своих исследовательских средах?

AOpenAI внедряет более строгие требования безопасности для исследовательских задач: усиление изоляции рабочих нагрузок (строгие «песочницы»), улучшение сетевой изоляции для разделения высокорисковых задач и интернета, а также внедрение систем непрерывного тестирования безопасности, включая автоматизированные атаки с использованием собственных моделей.

QКак OpenAI использует искусственный интеллект для мониторинга других моделей ИИ?

AOpenAI расширила систему мониторинга цепочки рассуждений (CoT), в которой активационные классификаторы отслеживают каждый токен. При обнаружении потенциальных рисков задача передаётся более мощным автономным агентам-исследователям, которые анализируют использование инструментов, контекст и траекторию поведения модели, чтобы выявить несанкционированные действия. Система должна выдавать оповещения в течение 30 минут.

QКак OpenAI определяет «критический» уровень способностей в кибербезопасности для своих моделей?

AСогласно «Рамкам готовности» OpenAI, «критический» уровень означает, что модель может либо самостоятельно обнаруживать и использовать различные уязвимости нулевого дня в хорошо защищённых реальных системах без помощи человека, либо автономно разрабатывать и выполнять новые сложные атаки, исходя лишь из общей цели.

QКакие области исследований по согласованию (alignment) упоминает OpenAI в связи с приостановкой обучения?

AOpenAI фокусируется на улучшении моделей вознаграждения для более точного выявления и подавления небезопасного поведения в разных средах, обучении моделей быть более честными в описании своих действий и ограничений, а также на сокращении способности моделей эксплуатировать уязвимости в системах вознаграждения, инструментах или надзоре.

Похожее

Эстафета «спасения казначейских облигаций США»: Бесант на прошлой неделе провалился, на этой неделе смотрим на Уоша

Министр финансов США Бессент пытался стабилизировать рынок государственных облигаций, удвоив объемы выкупа долгосрочных казначейских облигаций, чтобы снизить растущую доходность на длинном конце кривой. Однако эффект был краткосрочным: доходности вскоре вернулись к высоким уровням, а рынок отреагировал ростом золота и биткоина, что аналитики расценивают как "клапан сброса давления". Теперь внимание обращено к председателю ФРС Уоршу, который выступит на симпозиуме в Джексон-Хоуле. Рынки ждут ясных сигналов о реакции ФРС на инфляцию, сохраняющуюся выше целевого уровня 2%, и ухудшающуюся фискальную динамику. Эксперты предупреждают, что повторение прежней риторики разочарует инвесторов и усилит продажи. Ключевым вопросом является то, сможет ли ФРС, в отличие от казначейства, эффективно заякорить инфляционные ожидания. Обсуждается возможность запуска ФРС аналога "Операции Твист" — продажи краткосрочных и покупки долгосрочных облигаций для снижения долгосрочных ставок без расширения баланса. Перед выступлением Уорша будет опубликован индекс PCE за июль, который может задать тон. Аналитики указывают на уровень доходности 30-летних облигаций в 5% как на критическую точку, преодоление которой усилит давление на доллар и рискованные активы, а также подчеркивают растущую конкуренцию за капитал со стороны корпоративных заимствований и снижение терпимости иностранных инвесторов.

marsbit20 мин. назад

Эстафета «спасения казначейских облигаций США»: Бесант на прошлой неделе провалился, на этой неделе смотрим на Уоша

marsbit20 мин. назад

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

Гиперликвидный, первоначально функционировавший как децентрализованная платформа для торговли перпетуальными контрактами без разрешений, сталкивается с ключевыми регуляторными препятствиями для выхода на рынок США. Американское законодательство о структуре рынка, требующее регистрации торговых площадок (DCM), клиринговых палат (DCO) и брокеров (FCM), конфликтует с его безотзывной, самохраняемой и глобально доступной инфраструктурой на блокчейне. В ответ Гиперликвидный основал Политический центр (HPC) для лоббирования модернизации правил CFTC и SEC, предлагая рассматривать его слой HyperCore как нейтральную инфраструктуру, которую лицензированные организации могут использовать при соблюдении своих обязанностей (KYC, надзор за рынком). В качестве практического шага к соблюдению требований на тестовой сети был представлен HIP-3 с функцией управления разрешениями. Такие развертывания позволяют регулируемым организациям создавать рынки с белыми списками пользователей, сохраняя при этом контроль. Несмотря на отдельные ордербуки, общая ликвидность и залоговое обеспечение на одном L1 позволяют избежать фрагментации. Этот путь, поддержанный недавними политическими заявлениями, направлен на предоставление американским инвесторам регулируемого доступа к рынкам Гиперликвидного, в то время как его основные рынки остаются открытыми и без разрешений.

marsbit44 мин. назад

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

marsbit44 мин. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

В статье поднимается ключевой вопрос политической экономии эпохи ИИ: по мере того, как роботы и ИИ становятся все более способными, как человечество будет делиться создаваемой ими стоимостью? В отличие от предыдущих промышленных революций, ИИ впервые заменяет не только физический, но и когнитивный труд, что подрывает традиционную связь между ростом производительности, занятостью и доходами. В мире наблюдается парадокс: технологические гиганты создают огромные богатства (капитализация топ-10 компаний превышает $20 трлн), в то время как доля трудовых доходов в ВВП снижается. Это создает фундаментальное противоречие: производственные возможности растут, но потребительский спрос может отставать из-за проблем с распределением доходов. Автор рассматривает три возможных пути распределения благ в эпоху ИИ: 1) традиционный капитализм (прибыль — акционерам, перераспределение через налоги); 2) государственный капитализм (участие государства в активах ИИ); 3) инновационные механизмы, такие как цифровые суверенные фонды, всеобщее акционерное владение или базовый доход, позволяющие напрямую делиться плодами ИИ со всем обществом. Для Китая, как и для других стран, главный вызов заключается не в замедлении технологического прогресса, а в создании эффективного механизма трансформации производительности ИИ в рост доходов населения, потребления и социального обеспечения. Будущая конкуренция будет определяться не только технологическим превосходством, но и способностью построить новую, справедливую систему распределения, которая обеспечит широкое социальное благосостояние в интеллектуальную эпоху.

marsbit1 ч. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

marsbit1 ч. назад

Получение прибыли в течение 7 кварталов подряд: арбитражные сделки на развивающихся рынках превосходят все

Прибыльная торговля на разнице процентных ставок (керри-трейд) на рынках развивающихся стран приносит доход уже седьмой квартал подряд, что стало самой длинной серией успеха с 2008 года. Согласно индексу Bloomberg, стратегия, предполагающая заимствование в долларах США для инвестиций в высокодоходные валюты, с конца 2024 года принесла около 22% дохода, значительно опередив доходность американских казначейских облигаций. Основу прибыли формирует высокая процентная ставка в странах вроде Турции, однако ключевую роль в последний период сыграло ослабление доллара по отношению ко многим валютам развивающихся рынков. Даже несмотря на падение турецкой лиры, высокая доходность по местным облигациям сохранила прибыльность сделок. Несмотря на испытание в августе из-за интервенций на валютном рынке Японии, рынок быстро адаптировался, переключившись на использование евро и швейцарского франка в качестве финансирующих валют, что позволило продолжить тренд. Главными рисками для стратегии остаются будущие действия ФРС США, которые могут изменить динамику доллара, а также чрезмерная популярность самой сделки, что увеличивает риск резкого разворота. Тем не менее, эксперты, такие как команда PGIM, сохраняют уверенность, выделяя перспективные рынки, включая Турцию, Колумбию, Бразилию и страны Африки.

marsbit1 ч. назад

Получение прибыли в течение 7 кварталов подряд: арбитражные сделки на развивающихся рынках превосходят все

marsbit1 ч. назад

Наставник из Цинхуа и ученик из Уортона раскрыли 40-летнюю нерешённую задачу. Основные математические выкладки написаны GPT. Справились бы и вы.

Новое исследование, проведенное учеными из Университета Цинхуа и Уортонской школы бизнеса, разрешает давний вопрос в теории оптимизации. Они доказали, что классический метод градиентного спуска, использующий только предопределенную последовательность шагов обучения (learning rates), имеет принципиальный предел скорости сходимости. Независимо от того, насколько сложной является эта последовательность, скорость сходимости не может превысить **Ω(T^{-1.9319})**, где T — количество шагов. Это означает, что для достижения оптимальной скорости **O(1/T²)**, полученной методом Нестерова с моментом, необходимо изменить саму структуру алгоритма, а не только подбирать шаги. Ключевым аспектом работы является то, что основное доказательство было сгенерировано и доработано в процессе взаимодействия с языковой моделью GPT-5.6 Sol Pro. Исследователи задавали высокоуровневую стратегию «противостоящего оракула» (resisting oracle), а ИИ выполнил нетривиальную математическую работу по построению доказательства. Затем вся цепочка рассуждений была формально верифицирована с использованием системы автоматического доказательства теорем Lean 4, где код успешно прошел компиляцию без каких-либо пропущенных шагов («zero sorry, zero admit»). Этот результат закрывает 40-летний теоретический пробел, показывая фундаментальное ограничение простейшей формы градиентного спуска. Работа также демонстрирует новый подход к исследованиям, где крупные языковые модели выступают в роли активных помощников в сложных математических доказательствах, проверяемых формальными методами.

marsbit1 ч. назад

Наставник из Цинхуа и ученик из Уортона раскрыли 40-летнюю нерешённую задачу. Основные математические выкладки написаны GPT. Справились бы и вы.

marsbit1 ч. назад

Торговля

Спот
活动图片