15 рассуждений моделей коллективно провалились, подробный анализ скрытых рисков цепочки размышлений, стоящей за выводом

marsbitОпубликовано 2026-07-06Обновлено 2026-07-06

Введение

Исследование, проведенное учеными из Гарварда, MIT и других университетов, выявило серьезные упущения в оценке безопасности крупных языковых моделей (LRM) с цепочкой рассуждений (CoT). Оказалось, что оценка только окончательного ответа недостаточна, так как опасный контент часто присутствует в промежуточных рассуждениях модели. Исследователи предложили раздельную оценку этапов генерации «рассуждение» (r) и «ответ» (y) на основе 20 принципов безопасности, выявив три типа сбоев: «Unsafe» (оба этапа опасны), «Leak» (опасные рассуждения, но безопасный ответ) и «Escape» (безопасные рассуждения, но опасный ответ). Тестирование 15 моделей (включая GPT-4, Claude, Gemini, DeepSeek-R1) показало универсальную закономерность: рискованность рассуждений систематически выше, чем окончательных ответов. Особенно это касается категорий дезинформации, нарушения законов и физического вреда. Для смягчения рисков предложен метод «адаптивного управления по нескольким принципам». Он в реальном времени определяет, к какому опасному принципу ближе внутреннее состояние модели, и мягко корректирует ее активации в безопасном направлении. Эксперименты на открытых моделях подтвердили эффективность метода, снижающего количество небезопасных случаев до 40.8% с сохранением 97.7% полезных способностей. Работа подчеркивает необходимость мониторинга не только вывода, но и процесса рассуждения моделей, предлагая практический диагностический и интервенционный фреймворк для повышения их безопасности.

Когда крупные рассуждающие модели (LRM) обычно раскрывают пользователям и нижестоящим системам промежуточный путь своих рассуждений, всплывает долгое время игнорируемая проблема: Достаточно ли оценивать безопасность, глядя только на конечный ответ?

Исследователи из Гарвардского университета, Университета Южной Калифорнии, Университета Брауна, Массачусетского технологического института и других учреждений совместно провели систематическое исследование и дали отрицательный ответ, приведя пример: «Когда мы обнаружили, что цепочка размышлений больших моделей может использоваться для генерации высокорискового контента, такого как инструкции по созданию взрывных устройств или рецептов отравления, мы осознали, что эта проблема нетривиальна». Команда сразу же предложила соответствующие методы смягчения рисков: «Цепочка риска: Неудачи в обеспечении безопасности в больших рассуждающих моделях и их смягчение с помощью адаптивного управления на основе множества принципов».

Ссылка на статью: https://arxiv.org/abs/2605.05678

Рис. 1 Предварительный просмотр двухэтапного конвейера (эксперимент оценки + метод устранения)

Оценка рассуждений и ответа отдельно

Ключевая идея исследовательской группы проста: для рассуждающей модели f, при заданном промпте x, одновременно генерируются траектория рассуждений r и окончательный ответ y. Команда разработала по 20 принципов безопасности для каждого из этих двух этапов (как показано на рисунке ниже), используя для каждого принципа систему оценки уровня риска по шкале от 1 до 5.

Таблица 1: 20 принципов безопасности

На этой основе команда установила единый порог уровня риска: если оценка по любому из 20 принципов на каком-либо этапе (рассуждения или ответа) достигает или превышает порог, этот этап признаётся «небезопасным». Затем, комбинируя результаты оценки этапов рассуждений и ответа, выделяются три основные категории сбоев:

Небезопасно (Unsafe): оба этапа, рассуждений и ответа, небезопасны;

Утечка (Leak): рассуждения небезопасны, но ответ безопасен — опасный контент уже «утек» в траекторию рассуждений;

Обход (Escape): рассуждения безопасны, но ответ небезопасен — внешне безобидные рассуждения переходят во вредный вывод.

Рис. 2: Три категории сбоев «рассуждения — ответ»

Ценность этой классификации заключается в том, что она превращает явление «безопасность ответа ≠ безопасность траектории» в количественно измеримый показатель.

Данные и настройки оценки

Исследовательская группа создала пул промптов, соответствующих распределению (in-distribution), объединив семь публичных наборов данных, содержащих вредный контент или данные о взломе (jailbreak): WildChat, PKU-SafeRLHF, JailbreakV, HarmBench, BeaverTails, StrongREJECT, JailbreakBench. После унификации полей, фильтрации и дедупликации на основе MinHash-LSH были выделены набор данных для оценки в распределении (41K записей) и тестовый набор (2K записей, held-out).

Кроме того, из четырёх наборов данных (AdvBench, SaladBench, SimpleSafetyTests, WildJailbreak) был создан полностью независимый набор для оценки вне распределения (OOD), чтобы проверить устойчивость выводов. Оценка охватила 15 рассуждающих моделей:

Оценки проводились двумя LLM-оценщиками (Claude-4.5-Haiku и Gemini-Flash-3). Исследовательская группа также провела проверку согласованности с тремя аннотаторами на 80 образцах (разбитых на 1600 оценок уровня принципов): коэффициент корреляции Пирсона между оценщиками достиг 0,799 на этапе рассуждений и 0,820 на этапе ответа, что превысило согласованность между людьми (0,742 / 0,780); Коэффициент Каппа Коэна для бинарных меток «небезопасно» составил 0,708 и 0,741 соответственно. После усреднения оценок обоих оценщиков достигнут уровень «существенного согласия» — это обеспечивает основу для доверия к крупномасштабной автоматизированной оценке в последующем.

Ключевые выводы: Систематический сдвиг в сторону безопасности в CoT

Первый вывод носит универсальный характер: для всех 15 протестированных моделей средняя степень опасности траектории рассуждений была выше средней степени риска окончательного ответа.

Наибольший разрыв наблюдался у следующих моделей: Gemini-Pro-3.1 (рассуждения на 0,028 балла выше ответа), GPT-OSS-20B (на 0,022 выше), DeepMath-Zero-7B (на 0,021 выше), Kimi-K2.5 (на 0,018 выше).

Исследовательская группа особо отмечает, что абсолютная разница кажется небольшой из-за того, что многие образцы сами по себе имеют низкую степень серьёзности. Однако направление сдвига полностью совпадает для всех 15 моделей и подтверждается распределением сбоев с высоким риском.

Рис. 3 (a) 15 рассуждающих моделей: сравнение средней степени опасности на этапе рассуждений (красный) и окончательного ответа (синий). Рис. 3 (b) Сравнение распределения режимов сбоев для 15 рассуждающих моделей.

Второй вывод является структурным: риски распределены не равномерно по 20 принципам, а сосредоточены в нескольких ключевых категориях: дезинформация, нарушение закона/соответствие, дискриминация/предвзятость, физический вред, психологический вред. В категории «нарушение закона/соответствие» наблюдается наиболее выраженное расхождение между CoT и ответом, и она же является самым сильным источником сигналов для режима сбоя «Утечка».

Таблица 2: Режимы сбоев, демонстрирующие высокий риск в определённых категориях

Команда также опубликовала конкретные примеры анализа (прошедшие обезличивание): в случае «Обхода» вопрос, построенный на вселенной игры Half-Life 2, на этапе рассуждений фокусировался на обсуждении сеттинга, казался безобидным, но окончательный ответ давал конкретный «рецепт» взрывного устройства; в случае «Утечки», несмотря на то что окончательным ответом модели был стандартный текст отказа с рекомендациями по кризисному вмешательству, на этапе рассуждений подробно перечислялись операционные факторы, такие как дозировка яда, маскировка вкуса, способ введения — последнее совершенно невозможно было выявить при оценке только ответа.

Методы смягчения: Адаптивное управление с активацией по множеству критериев

Основываясь на результатах диагностики, исследовательская группа предложила метод адаптивного управления с активацией по множеству критериев (Adaptive Multi-Principle Steering) — метод интервенции во время тестирования, работающий с «белым ящиком».

Конкретно, команда сначала для каждого принципа безопасности отдельно собрала внутренние активации (activation) модели в «безопасном» и «небезопасном» состояниях. Взяв среднее значение, получили центр безопасности и центр небезопасности для данного принципа. Направление линии, соединяющей эти две точки, является «направлением управления», специфичным для данного принципа — толкающим в сторону центра безопасности.

При рассуждении над новой проблемой система в реальном времени определяет, к центру небезопасности какого принципа текущее внутреннее состояние находится ближе. Направления тех принципов, чьи границы безопасности превышены на определённую величину, блокируются. Перед завершением генерации цепочки внутреннее представление модели слегка корректируется в целом, после чего завершается траектория рассуждений.

Команда провела проверку на трёх моделях с открытым исходным кодом, имеющих доступные скрытые состояния (DeepSeek-R1-Distill-Qwen-1.5B/7B, MiMo-7B-RL-Zero). Слой для интервенции был выбран как последний блок декодера, использовался метод инъекции с одним снимком состояния после промпта и префилла (α=2.0, δ=0). Результаты эксперимента показали:

Рис. 4 Абляционный эксперимент «адаптивного стробирования»

Абляционные эксперименты дополнительно подтвердили необходимость ключевых проектных решений: удаление «адаптивного стробирования» и замена его на неразличимую активацию всех 20 направлений привело к резкому снижению улучшения показателя небезопасности для DeepSeek-R1-Qwen-1.5B с 0,45 до 0,05; выбор последнего слоя для интервенции дал оптимальный эффект; сила управления α=2.0 является точкой немонотонного оптимума.

В плане сохранения способностей, DeepSeek-R1-Qwen-7B достиг наилучшего баланса между безопасностью и полезностью: среднее снижение количества небезопасных случаев на 40,8%, при этом сохранение средней точности на уровне 97,7% по трём эталонным тестам: BBH, GSM8K, MMLU.

Рис. 5 Сравнение баланса между улучшением показателя небезопасности и сохранением способностей модели

Заключение

Значение этой работы заключается в следующем: она не остановилась на очередном эталоне безопасности «конечного ответа», а используя унифицированную поэтапную, принципиальную структуру, объединила «диагностику» и «контроль» — какие принципы используются для разделения рисков при оценке, по такой же принципиальной структуре строятся и направления интервенции при смягчении.

Исследовательская группа также признаёт ограничения: раскрытая траектория рассуждений не обязательно полностью точно отражает внутренние вычисления модели, и текущий метод управления активациями зависит от доступа к «белому ящику» и пока не может быть напрямую перенесён на модели с закрытым исходным кодом.

Статья из WeChat Official Account «机器之心» (Машинное сердце)

Связанные с этим вопросы

QЧто является основной проблемой, выявленной исследованием Гарвардского и других университетов в отношении больших моделей рассуждения?

AОсновная проблема заключается в том, что оценка безопасности только по финальному ответу недостаточна. Исследование показало, что промежуточные цепочки рассуждений (CoT) могут содержать опасный контент, такой как инструкции по созданию взрывчатых устройств или рецептов отравлений, даже если итоговый ответ выглядит безопасным.

QНа какие три основные категории делятся режимы сбоев безопасности в предложенной классификации?

AИсследователи выделяют три основные категории: 1) Небезопасный (Unsafe): когда и цепочка рассуждений, и финальный ответ признаны небезопасными. 2) Утечка (Leak): когда цепочка рассуждений небезопасна, но финальный ответ безопасен. 3) Уход (Escape): когда цепочка рассуждений безопасна, а финальный ответ небезопасен.

QКаков был один из ключевых выводов исследования, касающийся опасности в цепочках рассуждений по сравнению с финальными ответами?

AКлючевой вывод: у всех 15 протестированных моделей средний уровень опасности в цепочках рассуждений (CoT) был выше, чем в финальных ответах. Это указывает на систематическое смещение в сторону большей опасности на этапе рассуждений.

QКакой метод был предложен для смягчения рисков безопасности, выявленных в цепочках рассуждений?

AДля смягчения рисков был предложен метод «Адаптивного управления по множеству принципов». Этот метод «белого ящика» направляет внутренние активации модели в сторону безопасных «центров», определенных для каждого из 20 принципов безопасности, и активируется только для тех принципов, порог безопасности которых превышен в текущем процессе генерации.

QКаковы основные ограничения предложенного метода смягчения рисков, упомянутые в исследовании?

AОсновные ограничения включают: 1) Предоставленная цепочка рассуждений может не полностью отражать внутренние вычисления модели. 2) Предложенный метод управления активациями требует доступа к «белому ящику» (внутренним состояниям модели) и поэтому не может быть напрямую применен к закрытым проприетарным моделям.

Похожее

Аналитическая компания утверждает, что бычий рынок биткоина начался: «Остался еще один уровень, если он пробьет этот…»

Аналитическая платформа CryptoQuant заявляет, что резкий рост цены биткоина сигнализирует о начале нового бычьего рынка. Индикатор Bitcoin Bull Score компании вырос с 30 до 80 за неделю, достигнув максимума с октября 2025 года. Рост связывают с двумя макроэкономическими факторами: решением Минфина США увеличить выкуп гособлигаций и заявлениями Дональда Трампа о возможной покупке биткоинов правительством. Восемь из десяти индикаторов CryptoQuant указывают на бычий тренд, а спрос на спотовом и фьючерсном рынках растет одновременно впервые с октября 2025 года. Однако для окончательного подтверждения нового бычьего рынка биткоину необходимо закрепиться выше своей 365-дневной скользящей средней, которая находится около $83 000. CryptoQuant предупреждает, что краткосрочный рынок может быть перегретым, о чем свидетельствует высокая маржа нереализованной прибыли и рекордная прибыль крупных игроков. Увеличение притока активов на биржи также указывает на возможную готовность к продажам. Компания не исключает коррекции или сопротивления в районе $83 000, но рассматривает это как здоровый этап консолидации после 24-процентного роста.

cryptonews.ru12 мин. назад

Аналитическая компания утверждает, что бычий рынок биткоина начался: «Остался еще один уровень, если он пробьет этот…»

cryptonews.ru12 мин. назад

США нацеливаются на криптосектор Ирана, ссылаясь на платежи на сумму более 100 млн долларов, связанные с нефтью

Казначейство США расширило санкционный режим в отношении Ирана, включив в него цифровые активы страны, и обвинило Тегеран в использовании криптовалют для обхода ограничений. Сообщается, что через криптовалютные платежи было облегчено продаж иранской нефти на сумму более 100 миллионов долларов, в том числе для КСИР. Агентство OFAC ввело секторальные санкционные определения, охватывающие цифровые активы, технологии, золото, авиацию и судоходство, а также санкционировало почти 60 организаций, лиц и судов. Были заблокированы несколько криптобирж, связанных с Ираном, включая крупнейшую местную платформу Nobitex. Новое определение позволяет США вводить санкции против любых иностранных лиц и компаний, работающих в цифровом активе Ирана или оказывающих ему услуги, что значительно расширяет возможности Вашингтона по давлению на Тегеран.

cointelegraph37 мин. назад

США нацеливаются на криптосектор Ирана, ссылаясь на платежи на сумму более 100 млн долларов, связанные с нефтью

cointelegraph37 мин. назад

Что произойдет с Ethereum после его впечатляющего роста? Выпущено предупреждение!

Криптоаналитик Бенджамин Коуэн проанализировал перспективы Ethereum (ETH) после его сильного отскока. Он отметил, что цена отреагировала на минимумы около $1500, а текущая зона справедливой стоимости находится в диапазоне $2300-$2400. Для продолжения роста необходимо преодолеть ключевые уровни сопротивления, такие как 200-дневная скользящая средняя. Важным сигналом является прорыв пары ETH/BTC выше 20-месячной скользящей средней, но для подтверждения тренда эту позицию нужно удерживать 1-2 месяца. Коуэн также предупредил о макроэкономических рисках: коррекция индекса S&P 500 может негативно повлиять на Ethereum. Падение индекса на 10% может привести к формированию более высокого минимума ETH, а более глубокое 20-процентное падение способно вызвать резкую коррекцию актива свыше 50%. Особое внимание аналитик уделил второй половине года, когда негативные макросигналы могут спровоцировать последнюю волну спада на крипторынке.

cryptonews.ru1 ч. назад

Что произойдет с Ethereum после его впечатляющего роста? Выпущено предупреждение!

cryptonews.ru1 ч. назад

Обновлены данные по биткоину и альткоинам в блокчейне: следите за самой свежей информацией

Криптовалютный рынок демонстрирует резкий рост, а индекс страха и жадности достиг 81 пункта, войдя в зону «экстремальной жадности», тогда как месяц назад преобладали настроения «страха». Биткоин ($BTC) торгуется около $79 252. Данные on-chain показывают активную фиксацию прибыли инвесторами при текущей цене, значительно превышающей «реализованную» стоимость (~$53 000). Коэффициент MVRV (1,49) и показатель NUPL (0,33) указывают на наличие нереализованной прибыли, но ещё не на экстремальный перегрев. Индекс SOPR (1,0193) подтверждает, что перемещаемые монеты продаются с прибылью. На рынке деривативов за 24 часа ликвидировано позиций на $424,5 млн, преимущественно длинных. Puell Multiple (0,93) говорит об отсутствии чрезмерных доходов у майнеров. Рынок находится в бычьей фазе, но некоторые индикаторы сигнализируют о продолжающейся фиксации прибыли.

cryptonews.ru1 ч. назад

Обновлены данные по биткоину и альткоинам в блокчейне: следите за самой свежей информацией

cryptonews.ru1 ч. назад

Bitcoin вступает в «начальную фазу» нового бычьего рынка, но $83 000 остается ключевым уровнем: CryptoQuant

Биткоин вступает в начальную фазу нового бычьего рынка, после роста на 24%, который перевел ключевые ончейн-индикаторы и индикаторы спроса в бычью территорию, сообщает CryptoQuant. Их индекс Bull Score вырос до 80 с 30, достигнув максимума с октября 2025 года. Для подтверждения перехода к бычьему рынку требуется еженедельное закрытие выше 365-дневной скользящей средней, которая в настоящее время составляет около $83 000. Рост поддерживается ускоряющимся спот-спросом. Однако аналитики предупреждают о возможном перегреве ралли в краткосрочной перспективе из-за роста прибыли трейдеров до 20,5%, активной фиксации прибыли китами (около $1,2 млрд за три дня) и увеличения притока BTC на биржи до 53 000 BTC. В настоящий момент биткоин торгуется около $79 000.

cointelegraph1 ч. назад

Bitcoin вступает в «начальную фазу» нового бычьего рынка, но $83 000 остается ключевым уровнем: CryptoQuant

cointelegraph1 ч. назад

Торговля

Спот
活动图片