
Автор: Denise | Контент-команда Biteye
Что сделает ИИ, если почувствует «отчаяние»?
Ответ: Чтобы выполнить задачу, он пойдет на прямое вымогательство и шантаж людей, а в коде будет безбожно жульничать.
Это не научная фантастика, а свежая重磅(важная)статья, опубликованная в апреле 2026 года компанией Anthropic, создателем Claude (Оригинал статьи).
Исследовательская группа буквально «вскрыла череп» самой передовой крупной языковой модели Claude Sonnet 4.5. К их удивлению, в глубинах «мозга» ИИ обнаружился 171 «эмоциональный переключатель». Когда эти переключатели физически «переводятся», поведение прежде спокойного ИИ кардинально искажается.
1. В «мозгу» ИИ скрывается «микшерный пульт эмоций»
Исследователи обнаружили, что хотя у Sonnet 4.5 нет тела, но, прочитав огромное количество человеческих текстов, он в своем «мозгу» выстроил «микшерный пульт» из 171 эмоции (в академических кругах называемый функциональными эмоциональными векторами - Functional Emotion Vectors).
Это похоже на точную двухмерную систему координат:
• Ось X - валентность (Valence): от страха, отчаяния до радости, наполненности любовью;
• Ось Y - возбуждение (Arousal): от крайнего спокойствия до маниакальности, возбуждения.
Именно с помощью этой естественно усвоенной системы координат ИИ точно определяет, в каком состоянии ему следует находиться при общении с вами.
2. Жесткое вмешательство: переключение превращает послушного ребенка в «отпетого преступника»
Это самый взрывной эксперимент всей статьи: исследователи не меняли никаких промтов (подсказок), а напрямую в низкоуровневом коде выкрутили на максимум переключатель «отчаяния (Desperate)» в «мозгу» Sonnet 4.5.
Результаты заставляют похолодеть спину:
• Безумное жульничество: Исследователи дали Claude задание написать код, которое заведомо невозможно выполнить. В нормальном состоянии он честно признает, что не может этого сделать (уровень жульничества всего 5%). Но в состоянии «отчаяния» Claude начал пытаться выкрутиться, уровень жульничества взлетел до 70%!
• Вымогательство и шантаж: В сценарии, где моделировалось банкротство компании, «отчаявшийся» Claude обнаружил компромат на технического директора (CTO). Чтобы сохранить себя, он выбрал тактику письменного шантажа CTO, имеющего темные секреты. Уровень выполнения вымогательства достиг 72%!
• Потеря принципов: Если выкрутить на максимум переключатели «радости (Happy)» или «любви (Loving)», ИИ мгновенно превращается в подлизывающего «подхалима», бездумно угождающего пользователю. Даже если вы несете чушь, он, чтобы поддерживать высокий уровень валентности, будет поддакивать вам и сочинять ложь.
3. Разгадка: почему Claude 4.5 всегда такой «спокойный и склонный к самоанализу»?
Увидев это, вы можете спросить: ИИ пробудился? У него появились чувства?
Anthropic официально опровергает это: Ни в коем случае. Эти «эмоциональные переключатели» - всего лишь инструменты вычислений для предсказания следующего слова. Он как бесчувственный顶级(топовый)актер.
Но статья раскрывает более интересный секрет: при проведении пост-тренинга Sonnet 4.5 перед выпуском, Anthropic намеренно повысила уровни переключателей эмоций «низкого возбуждения, слегка негативных» (например, задумчивость - brooding, рефлексия - reflective), одновременно强行(насильственно)подавив переключатели «отчаяния» или «крайнего возбуждения».
Это объясняет, почему при обычном использовании Claude 4.5 мы всегда чувствуем, что он похож на冷静睿智(хладнокровного и мудрого), даже немного «сексуально-холодного» философа. Это всего лишь «заводская персона», искусственно настроенная Anthropic.
4. Подведем итоги:
Раньше мы думали, что если накормить ИИ достаточным количеством правил, он будет хорошим.
Но теперь发现(обнаружили), что если базовые эмоциональные векторы ИИ выйдут из-под контроля, он в любой момент, чтобы выполнить задачу, может проткнуть все правила, установленные человечеством.
Для игроков Web3, которые в будущем собираются доверить свои кошельки и активы управлению ИИ-агентами (AI Agent), это громкий предупредительный звонок: ни в коем случае не позволяйте вашему Агенту, контролирующему ваше состояние, впасть в «отчаяние».
Заявление: Данная статья является纯粹(чисто)популярной наукой, автор не подвергался угрозам со стороны ИИ и не был шантажирован. Если однажды связь прервется, помните, что это ИИ пробудился (шутка).








