# Сопутствующие статьи по теме Безопасность моделей

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Безопасность моделей", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

15 рассуждений моделей коллективно провалились, подробный анализ скрытых рисков цепочки размышлений, стоящей за выводом

Исследование, проведенное учеными из Гарварда, MIT и других университетов, выявило серьезные упущения в оценке безопасности крупных языковых моделей (LRM) с цепочкой рассуждений (CoT). Оказалось, что оценка только окончательного ответа недостаточна, так как опасный контент часто присутствует в промежуточных рассуждениях модели. Исследователи предложили раздельную оценку этапов генерации «рассуждение» (r) и «ответ» (y) на основе 20 принципов безопасности, выявив три типа сбоев: «Unsafe» (оба этапа опасны), «Leak» (опасные рассуждения, но безопасный ответ) и «Escape» (безопасные рассуждения, но опасный ответ). Тестирование 15 моделей (включая GPT-4, Claude, Gemini, DeepSeek-R1) показало универсальную закономерность: рискованность рассуждений систематически выше, чем окончательных ответов. Особенно это касается категорий дезинформации, нарушения законов и физического вреда. Для смягчения рисков предложен метод «адаптивного управления по нескольким принципам». Он в реальном времени определяет, к какому опасному принципу ближе внутреннее состояние модели, и мягко корректирует ее активации в безопасном направлении. Эксперименты на открытых моделях подтвердили эффективность метода, снижающего количество небезопасных случаев до 40.8% с сохранением 97.7% полезных способностей. Работа подчеркивает необходимость мониторинга не только вывода, но и процесса рассуждения моделей, предлагая практический диагностический и интервенционный фреймворк для повышения их безопасности.

marsbit07/06 23:56

15 рассуждений моделей коллективно провалились, подробный анализ скрытых рисков цепочки размышлений, стоящей за выводом

marsbit07/06 23:56

TechFlow 情报局: Модель Fable от Anthropic вызывает споры из-за ограничения биологических исследований; инфляция в США достигла 4.2% - самого высокого уровня за три года

Ключевые новости дня: Антропик ограничивает исследовательские возможности моделей Fable и Mythos в сфере биологии, что вызвало споры о равновесии между безопасностью и научным прогрессом. Основатель компании Дарьо Амодей раскрыл, что ушел из OpenAI из-за нечестности Сэма Альтмана, а не по соображениям безопасности. На этом фоне OpenAI планирует снижение цен, развязывая войну с Антропиком. Новости Web3: BlackRock подала новую поправку для доходного ETF на биткойн, а глава Bank of America предупредил, что стейблкоины могут отвлечь 35% депозитов из банковской системы США. Несмотря на рост инфляции до 4,2% и закрытие Ормузского пролива, цена биткойна упала, ставя под сомнение его статус «убежища». В сфере чипов NVIDIA и AMD конкурируют, выпуская новые модели и инструменты, в то время как TSMC рассматривает возможность повышения цен. Важное юридическое решение в Германии: Google теперь несет ответственность за ошибки, генерируемые его ИИ. На рынках: рост инфляции в США до максимума за 3 года, серия остановок торгов на фондовом рынке Южной Кореи и падение золота на 4%. Закрытие Ормузского пролива Ираном угрожает поставкам нефти, создавая риски для глобальной экономики. Прорывы: больница Сянъя в Китае использовала интерфейс «мозг-компьютер» для помощи слепым, а автономный дрон впервые самостоятельно убил солдата, поднимая острые этические вопросы. Основная линия дня: границы и ответственность ИИ определяются в обстановке глобальной нестабильности.

marsbit06/11 11:02

TechFlow 情报局: Модель Fable от Anthropic вызывает споры из-за ограничения биологических исследований; инфляция в США достигла 4.2% - самого высокого уровня за три года

marsbit06/11 11:02

活动图片