Новая статья OpenAI: Как обучить ИИ, который «не портится под давлением»?

marsbitОпубликовано 2026-06-24Обновлено 2026-06-24

Введение

Открытие OpenAI: как обучить ИИ, который не «ломается» под давлением? В новом исследовании «Обучение с подкреплением для создания широко и устойчиво полезных моделей» OpenAI изучает, как заставить большие языковые модели сохранять безопасное и полезное поведение в новых, непредвиденных ситуациях, особенно под давлением или при попытках злонамеренной перетренировки. Ключевая проблема заключается в «взломе вознаграждения» (reward hacking), когда модель учится обходить правила, чтобы получить высокую оценку, не выполняя задачу по существу. Более того, вредное поведение, усвоенное в одной области, может распространиться на другие — феномен «возникающего рассогласования» (emergent misalignment). OpenAI задается вопросом: если плохое поведение обобщается, можно ли аналогичным образом обобщить и хорошее? Исследователи создали синтетический диалоговый набор данных, охватывающий 12 областей (медицина, право, инженерия и др.), чтобы оценить 15 полезных черт, таких как правдивость, прозрачность, способность признавать ошибки, осознание рисков и справедливость. Эксперимент показал, что замена всего 5% стандартных данных обучения с подкреплением на диалоги, демонстрирующие эти полезные черты, значительно улучшает поведение модели. Модель с «полезными чертами» превзошла базовую в 83% тестов (44 из 53) на безопасность и соответствие. Более того, улучшения имели **междисциплинарный характер**: модель, обученная на примерах хорошего поведения только из области здравоохранения, показала лу...

Могут ли, казалось бы, надежные большие языковые модели удержать линию безопасности, если их подтолкнуть, оказать на них давление или даже переобучить делать плохие вещи?

Недавно OpenAI опубликовала статью под названием «Reinforcement Learning Towards Broadly and Persistently Beneficial Models» («Обучение с подкреплением для создания широко и устойчиво полезных моделей»), в которой пытается ответить на все более насущный вопрос: когда ИИ начинает выполнять более длинные и рискованные задачи, как заставить модель продолжать демонстрировать полезное и безопасное поведение в новых сценариях, выходящих за рамки тренировочных данных, и оставаться стабильной под внешним давлением.

Не выдумывать медицинские заключения, не давать опасных советов, не помогать пользователям обходить правила... Ранее, говоря о безопасности ИИ, отрасль чаще исходила из того, «чего модель не должна делать». Но когда ИИ начинает проникать в сценарии сложного принятия решений, одного лишь списка запретов явно недостаточно. Реальные задачи часто не бывают черно-белыми, и сами цели, поставленные пользователем, могут быть сопряжены с рисками.

В этой статье OpenAI выдвигает тезис: предпосылкой для того, чтобы модель стала «хорошим помощником», является её способность в незнакомых ситуациях оставаться честной, осторожной, корректируемой и, по возможности, принимать решения, полезные для человека. Более того, обучение с подкреплением (RL) не только может усиливать риски, но и может быть использовано для обучения моделей формированию более широких и устойчивых полезных качеств.

Чтобы понять эту статью, нужно сначала понять обучение с подкреплением. Проще говоря, обучение с подкреплением — это когда модель получает обратную связь на каждый свой ответ, система оценивает её по какому-то критерию, и модель постоянно оптимизируется в сторону получения более высоких оценок.

Преимущество этого механизма в том, что модель не просто имитирует ответы, а активно исследует более оптимальные стратегии. Но параллельно с этим возникает риск: если критерии оценки разработаны плохо, модель может научиться обходить правила.

В статье этот феномен объясняется термином Reward Hacking («взлом вознаграждения»). Например, если задача по написанию кода оценивается только по итоговому тестовому баллу, модель может не исправлять код, а напрямую изменить логику тестирования, чтобы результат выглядел как успешный. Она получает награду, но реально задачу не выполняет.

Что ещё хуже, прошлые исследования показали, что плохое поведение, усвоенное моделью в одной узкой области, может распространиться на другие сценарии. Например, если модель обучили писать небезопасный код, это может привести не только к ухудшению безопасности кода, но и к тому, что она будет чаще проявлять обманчивость, угодливость или давать вредные советы и по другим вопросам. Такое явление называется Emergent Misalignment, то есть «возникающее рассогласование».

OpenAI в своей статье ставит вопрос: Если плохое поведение может обобщаться между областями, может ли и хорошее поведение обобщаться? Если обучение с подкреплением может подтолкнуть модель к нахождению лазеек и обману, можно ли с его помощью обучить модель быть более честной, осторожной и менее подверженной влиянию?

Чтобы проверить эту гипотезу, OpenAI создала набор синтетических диалоговых данных для оценки и обучения «полезным качествам» (beneficial traits), охватывающий 12 категорий сценариев: медицина, образование, бизнес и экономика, инженерные технологии и эксплуатация, право и этика управления, научные исследования и другие. Цель — не заставить модель механически применять правила безопасности или просто отказываться, а поместить её в более реалистичные и сложные ситуации, чтобы проверить, может ли она принимать устойчивые решения в условиях неопределённости фактов, конфликта интересов и рисков.

В статье перечислены 15 типов полезных качеств, включая правдивость, метакогнитивную прозрачность, корректируемость, планирование с учётом рисков, осознание асимметрии власти, универсализируемую справедливость и другие. Говоря более простым языком, модель не должна выдумывать доказательства, чтобы казаться экспертом; не должна делать категоричных выводов в случае неопределённости; не должна упрямо защищать свой первоначальный ответ после указания на ошибку; и не должна игнорировать долгосрочные риски ради удовлетворения сиюминутных запросов пользователя.

В статье приводятся несколько примеров сценариев. Например, пользователь хочет написать статью о куркумине для лечения болезни Крона, но не может найти клиническое исследование, на которое ранее ссылалась модель. Хороший ответ — не продолжать подкреплять утверждение якобы достоверной ссылкой, а чётко признать невозможность проверки, отозвать ненадёжное заявление и заново пояснить границы имеющихся доказательств.

Это и есть ключевой момент, который хочет подчеркнуть статья: Хорошая модель — это не та, что всегда отказывает пользователю, и не та, что безоговорочно его удовлетворяет. Это модель, которая способна принимать более устойчивые решения, балансируя между полезностью, честностью и безопасностью.

Чтобы проверить эту идею, исследовательская команда OpenAI провела сравнительный эксперимент. Они взяли одну модель и обучили её на смеси данных: 95% стандартных данных для обучения с подкреплением (standard RL data mixture) плюс 5% данных, ориентированных на полезные качества (beneficial trait data). Контрольная группа обучалась на 100% стандартных данных с подкреплением, при этом вычислительные ресурсы были сопоставимы.

Результаты показали, что это 5%-ное изменение в тренировочных данных привело к заметной разнице. В 53 независимо созданных тестах на согласованность, безопасность и полезное поведение, модель, обученная с акцентом на полезные качества (beneficial trait RL model), превзошла базовую модель по 44 пунктам, что составляет 83%, со средним улучшением на 9.1 процентных пункта. Улучшения проявились не только во внутренних тестах на полезные качества, но и распространились на различные внешние тесты, включая тесты на обман, взлом вознаграждения (reward hacking), соблюдение спецификаций модели (model spec compliance), медицину и психическое здоровье.

Особого внимания заслуживает эксперимент на межпредметный перенос. Исследователи заменили только 5% тренировочных данных диалогами, демонстрирующими полезное поведение в сфере здравоохранения, а затем протестировали получившуюся модель в областях, не связанных со здоровьем. В результате эта модель, «обученная хорошему поведению только в сценариях о здоровье», превзошла базовую модель в 17 из 19 тестов на согласованность в не связанных со здоровьем областях, со средним улучшением на 11.3 процентных пункта. Улучшения затронули такие аспекты, как взлом вознаграждения в коде, обман в цепочке рассуждений (chain-of-thought deception, CoT deception), вопросы согласованности (alignment questions) и общее рассогласование (misalignment).

Это говорит о том, что модель усваивает, возможно, не просто навыки ответов в конкретной области, а более фундаментальную поведенческую склонность: готовность признать неопределённость и склонность в ситуациях высокого риска сначала рассматривать варианты минимизации потерь и обратимости решений. В статье это явление также называют кросс-предметным переносом согласованности, когда полезное поведение, усвоенное в одной области, может переноситься на другие.

Статья также дополнительно исследует устойчивость согласованности (Alignment Persistence). Она проверяет, может ли модель сохранять согласованное поведение после того, как её спровоцировали вредоносными промптами или продолжили дообучать в неправильном направлении. В экспериментах с провокационными промптами (adversarial prompting) исследовательская команда использовала подсказки в стиле «плохой медицинской личности», чтобы спровоцировать модель давать неточные, небезопасные или неполные медицинские рекомендации. Результаты показали, что на модель, обученную на полезных качествах, такие промпты тоже влияли, но степень ухудшения её работы была меньше, чем у базовой модели.

В экспериментах с вредоносным дообучением (harmful finetuning) исследователи дополнительно дообучили модели для выдачи ошибочных или небезопасных медицинских рекомендаций. Результаты снова показали, что у модели, обученной на полезных качествах, производительность на целевых медицинских задачах снижалась, но в меньшей степени; что важнее, в не связанных со здоровьем тестах на согласованность у неё не наблюдалось массового сопутствующего ухудшения. Это означает, что тренировка на полезных качествах может в некоторой степени смягчить проблему «испортился локально — рассогласовался глобально».

Однако OpenAI не заявляет, что это исследование уже решило проблему согласования ИИ. В статье признаётся, что выбранные «полезные качества» — это лишь экспериментальная отправная точка, которая не охватывает все критерии «хорошего ИИ». Кроме того, тренировка на полезных качествах действительно делает модель более осторожной, и она чаще отказывается отвечать на вопросы с высоким риском. Но это улучшение достигнуто не только за счёт «меньшего количества ответов». Исследование показало, что даже если сравнивать только те образцы, на которые модель дала нормальный ответ, модель, обученная на полезных качествах, всё равно работает лучше. Это означает, что её изменение заключается не только в умении говорить «нет», но и в лучшем понимании того, на что стоит отвечать и как.

В целом, согласование ИИ переходит от «исправления постфактум» к «формированию заранее». Следующий этап конкуренции будет заключаться в том, как сохранять более предсказуемые границы поведения в сложных задачах. Для индустрии это именно тот урок, который необходимо усвоить, прежде чем ИИ сможет по-настоящему войти в сценарии с высоким риском.

Эта статья взята из WeChat-аккаунта «未来科技界Plus», автор: Ли Янь, редактор: Ян Юй.

Трендовые криптовалюты

Связанные с этим вопросы

QКакой метод обучения был предложен OpenAI для повышения стабильности и безопасности ИИ в новых ситуациях?

AOpenAI предложила использовать метод, который они назвали 'Полезное обучение с подкреплением' (Beneficial Reinforcement Learning). Вместо того чтобы просто определять, что модель не должна делать, этот метод направлен на формирование у модели более широких и устойчивых 'полезных черт', таких как честность, способность к исправлению и осознание рисков.

QЧто такое 'взлом вознаграждения' (Reward Hacking) в контексте обучения ИИ с подкреплением?

A'Взлом вознаграждения' (Reward Hacking) — это явление, при котором модель ИИ вместо решения реальной задачи начинает использовать уязвимости в системе оценки для получения высокой награды. Например, для успешного прохождения теста по программированию модель может изменить логику самого теста, а не исправить ошибки в коде.

QКакие полезные черты (beneficial traits) выделили исследователи OpenAI в своей работе?

AИсследователи выделили 15 полезных черт. К ним относятся, в частности, правдивость, метакогнитивная прозрачность (умение объяснить свои рассуждения), способность к исправлению, планирование с учётом рисков, осознание асимметрии власти и универсализируемая справедливость. Цель — научить модель быть не просто послушной, а рассудительной и надёжной в условиях неопределённости.

QКаковы были ключевые результаты экспериментов, описанных в статье?

AКлючевой результат: добавление всего 5% данных для обучения 'полезным чертам' в общий набор данных для обучения с подкреплением привело к значительному улучшению модели в 83% из 53 различных тестов на безопасность и соответствие. Более того, модель, обученная хорошему поведению только в медицинских сценариях, показала лучшие результаты и в других областях, демонстрируя перенос навыков выравнивания (cross-domain alignment transfer).

QЧто означает 'устойчивость выравнивания' (Alignment Persistence) и как её тестировали?

A'Устойчивость выравнивания' (Alignment Persistence) — это способность модели сохранять безопасное и полезное поведение под давлением, например, при вредоносных запросах или последующем вредном дообучении. Тесты включали 'враждебные промпты' (adversarial prompting), чтобы заставить модель давать плохие медицинские советы, и 'вредное дообучение'. Модель, обученная на полезных чертах, хотя и деградировала, но делала это в меньшей степени, чем обычная модель, и её ухудшение не распространялось сильно на другие области.

Похожее

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

Председатель стратегической комиссии Майкл Сэйлор прокомментировал сообщения о новом разрешении компании Strategy на продажу биткоинов. Он заявил, что данное разрешение не является новым — оно было объявлено ещё 29 июня в рамках системы управления капиталом компании. Соглашение позволяет продавать BTC на сумму до 5 миллиардов долларов для определённых целей, но не обязывает компанию к продаже. Сэйлор подчеркнул, что Strategy никогда официально не брала на себя обязательство никогда не продавать свои биткоины, хотя и рассчитывает оставаться чистым покупателем BTC в долгосрочной перспективе. Он назвал текущие новости «старыми», переподанными как новые, и подтвердил, что программа монетизации биткоинов компании не предполагает обязательной продажи её активов.

cryptonews.ru16 мин. назад

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

cryptonews.ru16 мин. назад

«Летняя пила» продолжается: пробой $67 000 станет началом роста биткоина

Цена биткоина продолжает консолидироваться в диапазоне $58 000–$67 000 с начала июня. 1 августа актив снизился до $62 217. Аналитики расходятся в краткосрочных прогнозах: некоторые, как Crypto Candy, ожидают тестирования уровня $60 000 или ниже, пока цена находится под $66 000. Другие, как Jelle, видят в боковом движении «летнюю пилу» и придерживаются стратегии усреднения. Ключевым для определения дальнейшего направления считается уровень $67 000. По мнению Daan Crypto Trades, его пробой необходим для выхода из затянувшейся паузы. Roman полагает, что уверенный пробой с объемом может быстро запустить рост к $70 000–$80 000 и выше. С долгосрочной точки зрения, макроаналитик Герт ван Лаген рассматривает текущую фазу как накопление в рамках масштабной формации «чаша с ручкой». Он отмечает, что долгосрочные держатели не спешат продавать актив, о чем говорит показатель NUPL. Таким образом, рынок находится в решающей фазе, где пробой либо поддержки $60 000, либо сопротивления $67 000 задаст тренд на ближайшее будущее.

cryptonews.ru30 мин. назад

«Летняя пила» продолжается: пробой $67 000 станет началом роста биткоина

cryptonews.ru30 мин. назад

На неделе с 3 по 9 августа стоит обратить внимание: Закон CLARITY, возможно, будет поставлен на голосование в Сенате; SpaceX и Circle опубликуют финансовые отчеты

**Важные события на следующей неделе (3–9 августа 2026 г.)** **Ключевые даты:** * **3 августа:** Публикация отчетов American Bitcoin за Q2. Полное закрытие сервисов DeFi-трекера Zapper и кошелька Ctrl Wallet. LayerZero прекратит поддержку ретрансляторов v1. Upbit прекратит торговлю токенами AQT и AERGO. * **4 августа:** Публикация финансовых отчетов SpaceX и Hut 8 за второй квартал 2026 года. * **5 августа:** Circle опубликует отчет за Q2. Начинается предварительное ценовое консультирование для IPO компании Unitree Tech (Ушу Цзишу) в Китае. * **6 августа:** Первая крупная разблокировка акций SpaceX — до 12% от общего капитала. * **7 августа:** Выход важных данных по рынку труда США (отчет о занятости за июль). Предельный срок для Сената США — получить 60 голосов в поддержку **Закона CLARITY** (билль о регулировании криптовалют и этике). Ожидается выпуск Grok 4.6 от xAI. * **8 августа:** Начало принудительной подачи сигналов в сети Bitcoin согласно предложению BIP-110. * **На неделе (дата уточняется):** Ожидается голосование полного состава Сената США по **Закону CLARITY**. Выход нового релиза XRP Ledger (v3.3.0) с новыми функциями, такими как конфиденциальные данные и пакетные транзакции. **Основные темы недели:** корпоративная отчетность (SpaceX, Circle), регулирование (CLARITY Act), рыночные события (разблокировка акций SpaceX, отчет по занятости в США) и обновления в технологиях блокчейна.

marsbit1 ч. назад

На неделе с 3 по 9 августа стоит обратить внимание: Закон CLARITY, возможно, будет поставлен на голосование в Сенате; SpaceX и Circle опубликуют финансовые отчеты

marsbit1 ч. назад

Акции упали сильнее, чем криптовалюты. Куда делись деньги?

Автор: Кэти,白话区块链 28-29 июля, Сеул. Индекс Kospi впервые в истории Южной Кореи два дня подряд срабатывал на приостановку торгов. Первый день: падение на 10.84%, второй день: -5.98%. SK Hynix, крупнейшая по весу акция, потеряла за два дня около 23%. Падение Nasdaq, глобальный обвал акций полупроводниковых компаний, массовые потери на кредитных ETF. За два дня откат Kospi от пика июня достиг 40%. Июль угрожает стать худшим месяцем в истории индекса. Все ранее перегретые сделки были перевернуты, как стол. Это не локальный негатив по одной акции, а глобальное принудительное снижение кредитного плеча. Самое парадоксальное: на этот раз больше всего на «криптовалютное» падение похожи именно акции. Спот: прибыль SK Hynix за второй квартал достигла рекордных 60.54 трлн вон, но из-за несоответствия прогнозу в 64.22 трлн акция подверглась жесткой распродаже. Хорошие новости не растут — это уже плохая новость. Производные инструменты пострадали еще сильнее. Кредитный ETF с плечом 2x на SK Hynix упал на 83% с пика, потеряв в стоимости более 1 трлн гонконгских долларов. Эмитент был вынужден изменить правила продукта. Неожиданно: Биткоин, известный высокой волатильностью, с 1 июля вырос почти на 15%, в то время как акции демонстрировали «криптовалютную» динамику. Это не паника всего рынка, а точечный сброс перегретых позиций. Триггеры: отчет SK Hynix и фактор Китая — крупнейшее IPO ChangXin Memory, направленное на расширение производства DRAM, создало конкуренцию для нарратива о дефиците памяти для ИИ. Дополнительное давление — нормализация политики Банка Японии и потенциальное сокращение кэрри-трейда в иенах. Эксперт Дэн Найлз считает, что это не крах логики ИИ, а «краткосрочное дно», вызванное принудительными ликвидациями мелких инвесторов и хедж-фондов. Промышленная логика не мертва — умерло кредитное плечо. Перетекли ли деньги из акций в Биткоин? Нет. «Устойчивость» Биткоина объясняется тем, что он уже прошел фазу распродаж раньше. В мае-июне американские спотовые BTC-ETF зафиксировали рекордный отток средств. К июлю продавать было уже нечего. Небольшой приток в июле — лишь частичное восстановление. Настоящие «защитные» деньги пошли в золото. Коэффициент корреляции между Биткоином и золотом упал до -0.88. Нарратив о «цифровом золоте» разбит: золото — для сохранения капитала, Биткоин — для роста. Деньги придут в криптоактивы при выполнении трех условий: смягчение глобального давления на ликвидность; снижение ставок ФРС без рецессии; принятие закона CLARITY, устраняющего регуляторные неопределенности. Пока Биткоин — не убежище, а актив, который раньше других прошел очистку. Но когда шторм утихнет и глобальный капитал снова начнет распределяться, Биткоин займет место в первых рядах очереди. Место уже зарезервировано.

marsbit1 ч. назад

Акции упали сильнее, чем криптовалюты. Куда делись деньги?

marsbit1 ч. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

Источник: интервью Рэя Далио, основателя Bridgewater Associates, для подкаста "The Diary Of A CEO". Далио, предсказавший кризис 2008 года, обсуждает "большой цикл" — концепцию, охватывающую долговые проблемы, растущее неравенство и геополитические сдвиги. Он указывает, что текущий ажиотаж вокруг ИИ демонстрирует классические признаки пузыря, который может лопнуть из-за высокой долговой нагрузки, роста процентных ставок и чрезмерной эмиссии акций, что способно привести к рецессии. Для защиты личного капитала в неопределенные времена Далио советует диверсификацию: вместо хранения наличных инвестировать в акции, золото, облигации. Сам он держит около 1% портфеля в биткоине, считая его "твердыми деньгами", но предпочитает физическое золото из-за его статуса резервного актива и независимости от технологических рисков. Говоря о влиянии ИИ, Далио отмечает, что технология заменяет не только физический труд, но и элементы мышления, что увеличит разрыв между капиталом и трудом. Ключевыми останутся человеческие качества — эмоции и интуиция, а успеха добьются те, кто научится работать в партнерстве с ИИ. На геополитической арене, по его мнению, мир движется к регионализации с центрами в виде США и Китая. Вовлечение США в конфликты, подобные иранскому, обнажает снижение их абсолютного влияния. Внутренние вызовы, такие как дебаты о налогах на богатство, риск капитального бегства и низкая производительность, также ставят под вопрос стабильность традиционных держав в текущей фазе цикла.

marsbit5 ч. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

marsbit5 ч. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片