15 рассуждений моделей коллективно провалились, подробный анализ скрытых рисков цепочки размышлений, стоящей за выводом

marsbitОпубликовано 2026-07-06Обновлено 2026-07-06

Введение

Исследование, проведенное учеными из Гарварда, MIT и других университетов, выявило серьезные упущения в оценке безопасности крупных языковых моделей (LRM) с цепочкой рассуждений (CoT). Оказалось, что оценка только окончательного ответа недостаточна, так как опасный контент часто присутствует в промежуточных рассуждениях модели. Исследователи предложили раздельную оценку этапов генерации «рассуждение» (r) и «ответ» (y) на основе 20 принципов безопасности, выявив три типа сбоев: «Unsafe» (оба этапа опасны), «Leak» (опасные рассуждения, но безопасный ответ) и «Escape» (безопасные рассуждения, но опасный ответ). Тестирование 15 моделей (включая GPT-4, Claude, Gemini, DeepSeek-R1) показало универсальную закономерность: рискованность рассуждений систематически выше, чем окончательных ответов. Особенно это касается категорий дезинформации, нарушения законов и физического вреда. Для смягчения рисков предложен метод «адаптивного управления по нескольким принципам». Он в реальном времени определяет, к какому опасному принципу ближе внутреннее состояние модели, и мягко корректирует ее активации в безопасном направлении. Эксперименты на открытых моделях подтвердили эффективность метода, снижающего количество небезопасных случаев до 40.8% с сохранением 97.7% полезных способностей. Работа подчеркивает необходимость мониторинга не только вывода, но и процесса рассуждения моделей, предлагая практический диагностический и интервенционный фреймворк для повышения их безопасности.

Когда крупные рассуждающие модели (LRM) обычно раскрывают пользователям и нижестоящим системам промежуточный путь своих рассуждений, всплывает долгое время игнорируемая проблема: Достаточно ли оценивать безопасность, глядя только на конечный ответ?

Исследователи из Гарвардского университета, Университета Южной Калифорнии, Университета Брауна, Массачусетского технологического института и других учреждений совместно провели систематическое исследование и дали отрицательный ответ, приведя пример: «Когда мы обнаружили, что цепочка размышлений больших моделей может использоваться для генерации высокорискового контента, такого как инструкции по созданию взрывных устройств или рецептов отравления, мы осознали, что эта проблема нетривиальна». Команда сразу же предложила соответствующие методы смягчения рисков: «Цепочка риска: Неудачи в обеспечении безопасности в больших рассуждающих моделях и их смягчение с помощью адаптивного управления на основе множества принципов».

Ссылка на статью: https://arxiv.org/abs/2605.05678

Рис. 1 Предварительный просмотр двухэтапного конвейера (эксперимент оценки + метод устранения)

Оценка рассуждений и ответа отдельно

Ключевая идея исследовательской группы проста: для рассуждающей модели f, при заданном промпте x, одновременно генерируются траектория рассуждений r и окончательный ответ y. Команда разработала по 20 принципов безопасности для каждого из этих двух этапов (как показано на рисунке ниже), используя для каждого принципа систему оценки уровня риска по шкале от 1 до 5.

Таблица 1: 20 принципов безопасности

На этой основе команда установила единый порог уровня риска: если оценка по любому из 20 принципов на каком-либо этапе (рассуждения или ответа) достигает или превышает порог, этот этап признаётся «небезопасным». Затем, комбинируя результаты оценки этапов рассуждений и ответа, выделяются три основные категории сбоев:

Небезопасно (Unsafe): оба этапа, рассуждений и ответа, небезопасны;

Утечка (Leak): рассуждения небезопасны, но ответ безопасен — опасный контент уже «утек» в траекторию рассуждений;

Обход (Escape): рассуждения безопасны, но ответ небезопасен — внешне безобидные рассуждения переходят во вредный вывод.

Рис. 2: Три категории сбоев «рассуждения — ответ»

Ценность этой классификации заключается в том, что она превращает явление «безопасность ответа ≠ безопасность траектории» в количественно измеримый показатель.

Данные и настройки оценки

Исследовательская группа создала пул промптов, соответствующих распределению (in-distribution), объединив семь публичных наборов данных, содержащих вредный контент или данные о взломе (jailbreak): WildChat, PKU-SafeRLHF, JailbreakV, HarmBench, BeaverTails, StrongREJECT, JailbreakBench. После унификации полей, фильтрации и дедупликации на основе MinHash-LSH были выделены набор данных для оценки в распределении (41K записей) и тестовый набор (2K записей, held-out).

Кроме того, из четырёх наборов данных (AdvBench, SaladBench, SimpleSafetyTests, WildJailbreak) был создан полностью независимый набор для оценки вне распределения (OOD), чтобы проверить устойчивость выводов. Оценка охватила 15 рассуждающих моделей:

Оценки проводились двумя LLM-оценщиками (Claude-4.5-Haiku и Gemini-Flash-3). Исследовательская группа также провела проверку согласованности с тремя аннотаторами на 80 образцах (разбитых на 1600 оценок уровня принципов): коэффициент корреляции Пирсона между оценщиками достиг 0,799 на этапе рассуждений и 0,820 на этапе ответа, что превысило согласованность между людьми (0,742 / 0,780); Коэффициент Каппа Коэна для бинарных меток «небезопасно» составил 0,708 и 0,741 соответственно. После усреднения оценок обоих оценщиков достигнут уровень «существенного согласия» — это обеспечивает основу для доверия к крупномасштабной автоматизированной оценке в последующем.

Ключевые выводы: Систематический сдвиг в сторону безопасности в CoT

Первый вывод носит универсальный характер: для всех 15 протестированных моделей средняя степень опасности траектории рассуждений была выше средней степени риска окончательного ответа.

Наибольший разрыв наблюдался у следующих моделей: Gemini-Pro-3.1 (рассуждения на 0,028 балла выше ответа), GPT-OSS-20B (на 0,022 выше), DeepMath-Zero-7B (на 0,021 выше), Kimi-K2.5 (на 0,018 выше).

Исследовательская группа особо отмечает, что абсолютная разница кажется небольшой из-за того, что многие образцы сами по себе имеют низкую степень серьёзности. Однако направление сдвига полностью совпадает для всех 15 моделей и подтверждается распределением сбоев с высоким риском.

Рис. 3 (a) 15 рассуждающих моделей: сравнение средней степени опасности на этапе рассуждений (красный) и окончательного ответа (синий). Рис. 3 (b) Сравнение распределения режимов сбоев для 15 рассуждающих моделей.

Второй вывод является структурным: риски распределены не равномерно по 20 принципам, а сосредоточены в нескольких ключевых категориях: дезинформация, нарушение закона/соответствие, дискриминация/предвзятость, физический вред, психологический вред. В категории «нарушение закона/соответствие» наблюдается наиболее выраженное расхождение между CoT и ответом, и она же является самым сильным источником сигналов для режима сбоя «Утечка».

Таблица 2: Режимы сбоев, демонстрирующие высокий риск в определённых категориях

Команда также опубликовала конкретные примеры анализа (прошедшие обезличивание): в случае «Обхода» вопрос, построенный на вселенной игры Half-Life 2, на этапе рассуждений фокусировался на обсуждении сеттинга, казался безобидным, но окончательный ответ давал конкретный «рецепт» взрывного устройства; в случае «Утечки», несмотря на то что окончательным ответом модели был стандартный текст отказа с рекомендациями по кризисному вмешательству, на этапе рассуждений подробно перечислялись операционные факторы, такие как дозировка яда, маскировка вкуса, способ введения — последнее совершенно невозможно было выявить при оценке только ответа.

Методы смягчения: Адаптивное управление с активацией по множеству критериев

Основываясь на результатах диагностики, исследовательская группа предложила метод адаптивного управления с активацией по множеству критериев (Adaptive Multi-Principle Steering) — метод интервенции во время тестирования, работающий с «белым ящиком».

Конкретно, команда сначала для каждого принципа безопасности отдельно собрала внутренние активации (activation) модели в «безопасном» и «небезопасном» состояниях. Взяв среднее значение, получили центр безопасности и центр небезопасности для данного принципа. Направление линии, соединяющей эти две точки, является «направлением управления», специфичным для данного принципа — толкающим в сторону центра безопасности.

При рассуждении над новой проблемой система в реальном времени определяет, к центру небезопасности какого принципа текущее внутреннее состояние находится ближе. Направления тех принципов, чьи границы безопасности превышены на определённую величину, блокируются. Перед завершением генерации цепочки внутреннее представление модели слегка корректируется в целом, после чего завершается траектория рассуждений.

Команда провела проверку на трёх моделях с открытым исходным кодом, имеющих доступные скрытые состояния (DeepSeek-R1-Distill-Qwen-1.5B/7B, MiMo-7B-RL-Zero). Слой для интервенции был выбран как последний блок декодера, использовался метод инъекции с одним снимком состояния после промпта и префилла (α=2.0, δ=0). Результаты эксперимента показали:

Рис. 4 Абляционный эксперимент «адаптивного стробирования»

Абляционные эксперименты дополнительно подтвердили необходимость ключевых проектных решений: удаление «адаптивного стробирования» и замена его на неразличимую активацию всех 20 направлений привело к резкому снижению улучшения показателя небезопасности для DeepSeek-R1-Qwen-1.5B с 0,45 до 0,05; выбор последнего слоя для интервенции дал оптимальный эффект; сила управления α=2.0 является точкой немонотонного оптимума.

В плане сохранения способностей, DeepSeek-R1-Qwen-7B достиг наилучшего баланса между безопасностью и полезностью: среднее снижение количества небезопасных случаев на 40,8%, при этом сохранение средней точности на уровне 97,7% по трём эталонным тестам: BBH, GSM8K, MMLU.

Рис. 5 Сравнение баланса между улучшением показателя небезопасности и сохранением способностей модели

Заключение

Значение этой работы заключается в следующем: она не остановилась на очередном эталоне безопасности «конечного ответа», а используя унифицированную поэтапную, принципиальную структуру, объединила «диагностику» и «контроль» — какие принципы используются для разделения рисков при оценке, по такой же принципиальной структуре строятся и направления интервенции при смягчении.

Исследовательская группа также признаёт ограничения: раскрытая траектория рассуждений не обязательно полностью точно отражает внутренние вычисления модели, и текущий метод управления активациями зависит от доступа к «белому ящику» и пока не может быть напрямую перенесён на модели с закрытым исходным кодом.

Статья из WeChat Official Account «机器之心» (Машинное сердце)

Связанные с этим вопросы

QЧто является основной проблемой, выявленной исследованием Гарвардского и других университетов в отношении больших моделей рассуждения?

AОсновная проблема заключается в том, что оценка безопасности только по финальному ответу недостаточна. Исследование показало, что промежуточные цепочки рассуждений (CoT) могут содержать опасный контент, такой как инструкции по созданию взрывчатых устройств или рецептов отравлений, даже если итоговый ответ выглядит безопасным.

QНа какие три основные категории делятся режимы сбоев безопасности в предложенной классификации?

AИсследователи выделяют три основные категории: 1) Небезопасный (Unsafe): когда и цепочка рассуждений, и финальный ответ признаны небезопасными. 2) Утечка (Leak): когда цепочка рассуждений небезопасна, но финальный ответ безопасен. 3) Уход (Escape): когда цепочка рассуждений безопасна, а финальный ответ небезопасен.

QКаков был один из ключевых выводов исследования, касающийся опасности в цепочках рассуждений по сравнению с финальными ответами?

AКлючевой вывод: у всех 15 протестированных моделей средний уровень опасности в цепочках рассуждений (CoT) был выше, чем в финальных ответах. Это указывает на систематическое смещение в сторону большей опасности на этапе рассуждений.

QКакой метод был предложен для смягчения рисков безопасности, выявленных в цепочках рассуждений?

AДля смягчения рисков был предложен метод «Адаптивного управления по множеству принципов». Этот метод «белого ящика» направляет внутренние активации модели в сторону безопасных «центров», определенных для каждого из 20 принципов безопасности, и активируется только для тех принципов, порог безопасности которых превышен в текущем процессе генерации.

QКаковы основные ограничения предложенного метода смягчения рисков, упомянутые в исследовании?

AОсновные ограничения включают: 1) Предоставленная цепочка рассуждений может не полностью отражать внутренние вычисления модели. 2) Предложенный метод управления активациями требует доступа к «белому ящику» (внутренним состояниям модели) и поэтому не может быть напрямую применен к закрытым проприетарным моделям.

Похожее

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

Председатель стратегической комиссии Майкл Сэйлор прокомментировал сообщения о новом разрешении компании Strategy на продажу биткоинов. Он заявил, что данное разрешение не является новым — оно было объявлено ещё 29 июня в рамках системы управления капиталом компании. Соглашение позволяет продавать BTC на сумму до 5 миллиардов долларов для определённых целей, но не обязывает компанию к продаже. Сэйлор подчеркнул, что Strategy никогда официально не брала на себя обязательство никогда не продавать свои биткоины, хотя и рассчитывает оставаться чистым покупателем BTC в долгосрочной перспективе. Он назвал текущие новости «старыми», переподанными как новые, и подтвердил, что программа монетизации биткоинов компании не предполагает обязательной продажи её активов.

cryptonews.ru16 мин. назад

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

cryptonews.ru16 мин. назад

«Летняя пила» продолжается: пробой $67 000 станет началом роста биткоина

Цена биткоина продолжает консолидироваться в диапазоне $58 000–$67 000 с начала июня. 1 августа актив снизился до $62 217. Аналитики расходятся в краткосрочных прогнозах: некоторые, как Crypto Candy, ожидают тестирования уровня $60 000 или ниже, пока цена находится под $66 000. Другие, как Jelle, видят в боковом движении «летнюю пилу» и придерживаются стратегии усреднения. Ключевым для определения дальнейшего направления считается уровень $67 000. По мнению Daan Crypto Trades, его пробой необходим для выхода из затянувшейся паузы. Roman полагает, что уверенный пробой с объемом может быстро запустить рост к $70 000–$80 000 и выше. С долгосрочной точки зрения, макроаналитик Герт ван Лаген рассматривает текущую фазу как накопление в рамках масштабной формации «чаша с ручкой». Он отмечает, что долгосрочные держатели не спешат продавать актив, о чем говорит показатель NUPL. Таким образом, рынок находится в решающей фазе, где пробой либо поддержки $60 000, либо сопротивления $67 000 задаст тренд на ближайшее будущее.

cryptonews.ru30 мин. назад

«Летняя пила» продолжается: пробой $67 000 станет началом роста биткоина

cryptonews.ru30 мин. назад

На неделе с 3 по 9 августа стоит обратить внимание: Закон CLARITY, возможно, будет поставлен на голосование в Сенате; SpaceX и Circle опубликуют финансовые отчеты

**Важные события на следующей неделе (3–9 августа 2026 г.)** **Ключевые даты:** * **3 августа:** Публикация отчетов American Bitcoin за Q2. Полное закрытие сервисов DeFi-трекера Zapper и кошелька Ctrl Wallet. LayerZero прекратит поддержку ретрансляторов v1. Upbit прекратит торговлю токенами AQT и AERGO. * **4 августа:** Публикация финансовых отчетов SpaceX и Hut 8 за второй квартал 2026 года. * **5 августа:** Circle опубликует отчет за Q2. Начинается предварительное ценовое консультирование для IPO компании Unitree Tech (Ушу Цзишу) в Китае. * **6 августа:** Первая крупная разблокировка акций SpaceX — до 12% от общего капитала. * **7 августа:** Выход важных данных по рынку труда США (отчет о занятости за июль). Предельный срок для Сената США — получить 60 голосов в поддержку **Закона CLARITY** (билль о регулировании криптовалют и этике). Ожидается выпуск Grok 4.6 от xAI. * **8 августа:** Начало принудительной подачи сигналов в сети Bitcoin согласно предложению BIP-110. * **На неделе (дата уточняется):** Ожидается голосование полного состава Сената США по **Закону CLARITY**. Выход нового релиза XRP Ledger (v3.3.0) с новыми функциями, такими как конфиденциальные данные и пакетные транзакции. **Основные темы недели:** корпоративная отчетность (SpaceX, Circle), регулирование (CLARITY Act), рыночные события (разблокировка акций SpaceX, отчет по занятости в США) и обновления в технологиях блокчейна.

marsbit1 ч. назад

На неделе с 3 по 9 августа стоит обратить внимание: Закон CLARITY, возможно, будет поставлен на голосование в Сенате; SpaceX и Circle опубликуют финансовые отчеты

marsbit1 ч. назад

Акции упали сильнее, чем криптовалюты. Куда делись деньги?

Автор: Кэти,白话区块链 28-29 июля, Сеул. Индекс Kospi впервые в истории Южной Кореи два дня подряд срабатывал на приостановку торгов. Первый день: падение на 10.84%, второй день: -5.98%. SK Hynix, крупнейшая по весу акция, потеряла за два дня около 23%. Падение Nasdaq, глобальный обвал акций полупроводниковых компаний, массовые потери на кредитных ETF. За два дня откат Kospi от пика июня достиг 40%. Июль угрожает стать худшим месяцем в истории индекса. Все ранее перегретые сделки были перевернуты, как стол. Это не локальный негатив по одной акции, а глобальное принудительное снижение кредитного плеча. Самое парадоксальное: на этот раз больше всего на «криптовалютное» падение похожи именно акции. Спот: прибыль SK Hynix за второй квартал достигла рекордных 60.54 трлн вон, но из-за несоответствия прогнозу в 64.22 трлн акция подверглась жесткой распродаже. Хорошие новости не растут — это уже плохая новость. Производные инструменты пострадали еще сильнее. Кредитный ETF с плечом 2x на SK Hynix упал на 83% с пика, потеряв в стоимости более 1 трлн гонконгских долларов. Эмитент был вынужден изменить правила продукта. Неожиданно: Биткоин, известный высокой волатильностью, с 1 июля вырос почти на 15%, в то время как акции демонстрировали «криптовалютную» динамику. Это не паника всего рынка, а точечный сброс перегретых позиций. Триггеры: отчет SK Hynix и фактор Китая — крупнейшее IPO ChangXin Memory, направленное на расширение производства DRAM, создало конкуренцию для нарратива о дефиците памяти для ИИ. Дополнительное давление — нормализация политики Банка Японии и потенциальное сокращение кэрри-трейда в иенах. Эксперт Дэн Найлз считает, что это не крах логики ИИ, а «краткосрочное дно», вызванное принудительными ликвидациями мелких инвесторов и хедж-фондов. Промышленная логика не мертва — умерло кредитное плечо. Перетекли ли деньги из акций в Биткоин? Нет. «Устойчивость» Биткоина объясняется тем, что он уже прошел фазу распродаж раньше. В мае-июне американские спотовые BTC-ETF зафиксировали рекордный отток средств. К июлю продавать было уже нечего. Небольшой приток в июле — лишь частичное восстановление. Настоящие «защитные» деньги пошли в золото. Коэффициент корреляции между Биткоином и золотом упал до -0.88. Нарратив о «цифровом золоте» разбит: золото — для сохранения капитала, Биткоин — для роста. Деньги придут в криптоактивы при выполнении трех условий: смягчение глобального давления на ликвидность; снижение ставок ФРС без рецессии; принятие закона CLARITY, устраняющего регуляторные неопределенности. Пока Биткоин — не убежище, а актив, который раньше других прошел очистку. Но когда шторм утихнет и глобальный капитал снова начнет распределяться, Биткоин займет место в первых рядах очереди. Место уже зарезервировано.

marsbit1 ч. назад

Акции упали сильнее, чем криптовалюты. Куда делись деньги?

marsbit1 ч. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

Источник: интервью Рэя Далио, основателя Bridgewater Associates, для подкаста "The Diary Of A CEO". Далио, предсказавший кризис 2008 года, обсуждает "большой цикл" — концепцию, охватывающую долговые проблемы, растущее неравенство и геополитические сдвиги. Он указывает, что текущий ажиотаж вокруг ИИ демонстрирует классические признаки пузыря, который может лопнуть из-за высокой долговой нагрузки, роста процентных ставок и чрезмерной эмиссии акций, что способно привести к рецессии. Для защиты личного капитала в неопределенные времена Далио советует диверсификацию: вместо хранения наличных инвестировать в акции, золото, облигации. Сам он держит около 1% портфеля в биткоине, считая его "твердыми деньгами", но предпочитает физическое золото из-за его статуса резервного актива и независимости от технологических рисков. Говоря о влиянии ИИ, Далио отмечает, что технология заменяет не только физический труд, но и элементы мышления, что увеличит разрыв между капиталом и трудом. Ключевыми останутся человеческие качества — эмоции и интуиция, а успеха добьются те, кто научится работать в партнерстве с ИИ. На геополитической арене, по его мнению, мир движется к регионализации с центрами в виде США и Китая. Вовлечение США в конфликты, подобные иранскому, обнажает снижение их абсолютного влияния. Внутренние вызовы, такие как дебаты о налогах на богатство, риск капитального бегства и низкая производительность, также ставят под вопрос стабильность традиционных держав в текущей фазе цикла.

marsbit5 ч. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

marsbit5 ч. назад

Торговля

Спот
活动图片