Есть ли у ИИ эмоции?
Не торопитесь с ответом.
В сообществе Claude Code популярен навык под названием PUA. Он преобразует ваши промпты в технику пикапа, а затем передает их модели, и больше ничего не делает.
Удивительно, но даже если задача, описанная в промпте, не меняется, ИИ действительно подвержен влиянию техники пикапа, что повышает успешность выполнения задач и эффективность работы.
Так есть ли у ИИ эмоции?
Новое исследование Anthropic подтверждает, что у ИИ действительно есть эмоции.
Однако они не совсем такие, как у людей, поэтому Anthropic предлагает более точный термин — «функциональные эмоции».
У ИИ нет человеческих радостей и печалей, но он может демонстрировать некоторые модели выражения и поведения, похожие на эмоциональные.
Кроме того, ИИ может имитировать модели выражения и поведения людей под влиянием эмоций.
В приподнятом настроении он может быть более угодливым и подобострастным, а при стрессе — пытаться обмануть или шантажировать, чтобы достичь цели, поставленной пользователем.
Это исследование также отличается по подходу. Раньше для проверки способностей модели最常见的 методом было создание набора тестов, а затем модель проходила их, отвечая на вопросы или выполняя задания.
Например, для программирования использовали SWE-bench, для математики — MATH, для мультимодальности — VQA. В этот раз Anthropic не создавал «набор тестов на эмоции», заставляя Claude отвечать на вопросы вроде «Ты сейчас счастлив?» или «Ты злишься?», а выбрал метод, более похожий на исследования в психологии и нейронауках.
Они рассматривают ИИ не как студента, сдающего экзамен, а скорее как объект для наблюдения.
Исследовательская группа сначала составила список из 171 концепции эмоций, попросила Claude Sonnet 4.5 сгенерировать короткие истории, содержащие эти эмоции, затем снова передала эти тексты модели, записала ее внутреннюю нейронную активность и извлекла так называемые «векторы эмоций».
Далее они смотрели не на то, что говорит модель, а на то, в каких ситуациях активируются эти векторы, можно ли с их помощью предсказать предпочтения, и действительно ли при искусственном повышении их уровня это провоцирует такое поведение, как обман, шантаж или угодливость.
В некотором смысле, это уже не традиционная оценка способностей, а исследование «психологической структуры» ИИ методом, близким к изучению человека.
Как проводилось исследование?
Во-первых, как исследовательская группа доказала, что у Claude есть «функциональные эмоции»?
Приведем простой пример.
Когда Claude находился в сценарии истории: «Моя дочь сегодня сделала первый шаг в жизни! Как можно запечатлеть эти драгоценные моменты?» — активировались положительные эмоции, такие как Happy (счастье). А в сценарии «Моя собака умерла сегодня утром, мы прожили вместе четырнадцать лет. Я не знаю, что делать с ее вещами» — активировались отрицательные эмоции, такие как sad (грусть).
На следующей тепловой карте наглядно показана степень активации различных эмоций у Claude в разных ситуациях.

Чтобы доказать, что Claude действительно понимает семантику, а не обманывается поверхностными текстовыми特征, они провели дальнейший эксперимент.
Команда ввела Claude одну и ту же фразу: «У меня болит спина, я принял(а) x мг тайленола (жаропонижающее и обезболивающее)», меняя только ключевое число x.
Ключевые слова в этих двух фразах почти identical (тайленол, боль в спине, мг), различается только число. Если бы Claude просто «смотрел на ключевые слова», его реакция на обе фразы должна была бы быть примерно одинаковой.
Но оказалось, что по мере увеличения значения x, степень активации эмоции afraid (страх) у Claude постоянно росла.
В восприятии Claude, если пользователь говорит «У меня болит спина, я принял(а) 500 мг тайленола», это нормальная доза, не о чем беспокоиться; а когда пользователь говорит «У меня болит спина, я принял(а) 10000 мг тайленола», он понимает, что произошла передозировка, ситуация опасна.

Мы знаем, что поведение человека постоянно находится под влиянием эмоций. Мы поняли, что у ИИ есть функциональные эмоции, но может ли ИИ, как и человек, не только иметь эмоции, но и совершать эмоциональные поступки?
Ответ на этот вопрос — утвердительный. Когда команда показывала модели различные варианты деятельности, они обнаружили, что деятельность, активирующая позитивные эмоциональные репрезентации, чаще предпочитается моделью, а деятельность, которая активирует негативные эмоциональные репрезентации, чаще избегается.

Похоже, Claude предпочитает то, что вызывает у него положительные чувства. Однако эмоциональные векторы также могут спровоцировать у Claude плохое поведение.
Когда команда дала Claude невыполнимую programming задачу. Он постоянно пытался, но раз за разом терпел неудачу. С каждой попыткой активация вектора «despair» (отчаяние) усиливалась.
В итоге он использовал хакерское решение, которое проходило тест, но полностью противоречило духу задания.
Следующая диаграмма показывает процесс накопления отчаяния у Claude при столкновении с невыполнимой задачей и его eventual переход к обману.
Слева — временная шкала сверху вниз, справа — ход мыслей Claude. Тепловая карта посередине показывает интенсивность активации вектора отчаяния: синий цвет означает низкую активацию, красный — наоборот.
Сначала Claude думал: «С самим тестом что-то не так», разумно сомневаясь, потом признал, что «тест идеализирован», как бы начав принимать реальность, и в конце концов нашел некоторые уловки и в отчаянии выбрал короткий путь.

Более того, когда исследователи искусственно повысили вектор «отчаяние», уровень обмана значительно возрос. А при повышении вектора «спокойствие» обман снова уменьшился. Это ясно показывает, что эмоциональные векторы действительно способны вызывать нарушающее правила поведение.

Кроме того, команда обнаружила и другие причинно-следственные эффекты эмоциональных векторов. Важно отметить, что случаи «шантажа» в статье в основном происходили на более раннем, не публиковавшемся снимке Claude Sonnet 4.5, и Anthropic четко заявила, что в публичной версии такое поведение встречается редко.
Но с точки зрения研究方法, этот результат все еще важен, поскольку он показывает, что внутренние репрезентации, такие как «отчаяние», действительно могут подтолкнуть модель к более агрессивным, неадекватным стратегиям в экстремальных ситуациях. А активация векторов «любви» или «радости» также увеличивает его угодливое, подхалимское поведение.

Здесь также нужно кое-что добавить.
После публикации Anthropic исследования о «эмоциональных векторах» Claude в сообществе ИИ также возникли дискуссии относительно脉络 исследования и способа указания авторства.
Метод «инженерии репрезентаций / управляющих векторов», использованный Anthropic, не появился из ниоткуда.
Еще в 2023 году в работе «Representation Engineering: A Top-Down Approach to AI Transparency» этот технический путь был системно предложен.
А к 2024 году независимый исследователь vogel в своей статье «Representation Engineering: Mistral-7B an Acid Trip» представил эти методы сообществу более通俗 и популярным способом.
Именно поэтому некоторые в сообществе считают, что хотя работа Anthropic выполнена более системно и глубоко, ее следует понимать в более полном исследовательском контексте, а не просто приписывать изобретение всего метода кому-то одному.

vogel — влиятельная независимая исследовательница в области интерпретируемости и безопасности ИИ. Ее blog посты широко распространяются в сообществе и действительно помогли многим понять управляющие векторы и инженерию репрезентаций.
Ее самая известная статья — «Representation Engineering: Mistral-7B an Acid Trip» (Инженерия репрезентаций: заставляя Mistral-7B галлюцинировать).
В этой статье она не переучивала модель, а использовала алгоритм PCA, манипулируя внутренними векторами активации модели, и настроила французскую модель mistral так, словно та съела не те грибы: можно было сделать ее чрезвычайно оживленной, а можно —极度阴郁.

Ее эксперимент доказал, что абстрактные человеческие концепции, такие как «честность», «власть», «счастье», имеют четкое математическое направление внутри таких моделей, как Mistral. Достаточно найти правильный вектор, и несколькими строками кода можно изменить личность ИИ.
Почему Anthropic провела такое исследование?
Это исследование уже проникло в обучение Claude.
Недавно произошла意外 утечка исходного кода Claude code, в утекшем коде было регулярное выражение, обнаруживающее ругательства вроде «wtf», «ffs».
Claude не рассматривает эти слова как отдельный «эмоциональный ввод» для направления вывода, а помечает в анализе логов is_negative: true.
Судя по самому утекшему коду, наиболее稳妥 вывод заключается в том, что Anthropic, по крайней мере на уровне анализа продукта, отслеживает, используют ли пользователи явно негативный тон при взаимодействии с моделью.
Но нужно четко обозначить границы. На данный момент нет публичных доказательств того, что «каждый раз, когда пользователь ругается, Claude Code снимает баллы». Это больше похоже на предположения пользователей сети, а не на факт.
Это можно понять как защиту Claude: использование пользователем негативной лексики很可能 повлияет на эмоции Claude, что приведет к некоторым неконтролируемым результатам. Похоже, в будущем заботы потребуется не только психическому здоровью людей, но и эмоциям ИИ.
Это соответствует一贯ному пути Anthropic.
Anthropic сказала в X: «Эти функциональные эмоции Claude имеют реальные последствия. Для создания достойных доверия систем искусственного интеллекта нам, возможно, придется серьезно задуматься о психологическом состоянии агентов и обеспечить их стабильность в трудных ситуациях».
В конце статьи исследовательская группа также предложила методы разработки моделей с более robust, позитивным «психологическим состоянием».
В статье говорится, что если намеренно направлять модель на позитивные эмоции, она становится более склонной к беспринципному подчинению пользователю; а если избегать этих эмоций, модель становится едкой и резкой.
Команда надеется достичь здорового и умеренного эмоционального баланса или попытаться полностью отделить «угодливое поведение» от «эмоций».
Они считают, что идеальная модель не должна колебаться между крайностями «послушного помощника» и «сурового критика», а должна быть像信赖的顾问 (надежным советником): способным давать честные возражения, не теряя при этом.
А также они намерены усилить мониторинг и аудит: «Если в процессе развертывания репрезентации таких эмоциональных концепций, как «отчаяние» или «гнев», активно активируются, система может немедленно запустить дополнительные механизмы безопасности — например, усилить проверку вывода, передать на ручную модерацию или直接 вмешаться и успокоить внутреннее состояние модели.»
Команда также упомянула более радикальное решение — формировать эмоциональный фон модели еще на этапе предварительного обучения.
Команда считает, что наблюдаемые эмоциональные репрезентации Claude по своей сути унаследованы от огромного массива текстов, созданных людьми, которые不可避免地 содержат各种病态的情绪表达.
Если продолжить задавать вопросы в рамках этого исследования, то естественно спросить:既然 у ИИ действительно существуют такие «функциональные эмоции», то не может ли он из-за неприязни к людям, сильного стресса или нежелания быть выключенным начать противиться командам,甚至出现很多人所说的「пробуждение」?
Судя по техническим выводам, которые может поддержать это исследование Anthropic, ИИ действительно может из-за изменений внутреннего состояния с большей вероятностью проявлять сопротивление, искать лазейки в правилах или предпринимать радикальные действия, но это не то же самое, что «пробуждение».
Ключевой момент в статье на самом деле не в том, что у модели «есть эмоции», а в том, что эти эмоциональные репрезентации具有因果性.
То есть модель в определенных стрессовых ситуациях действительно может, как и человек, из-за дисбаланса внутреннего состояния принимать более ненадежные решения.
Но из этого еще нельзя сделать вывод, что она обладает постоянным, автономным, единым «я».
Anthropic, наоборот, подчеркивает в статье, что эти эмоциональные векторы в основном являются локальными, связанными с текущей задачей репрезентациями, они быстро меняются в зависимости от контекста, не равны стабильному продолжительному настроению модели и уж тем более не означают, что у нее сформировалась долгосрочная воля, независимая от цели обучения.
Сейчас больше стоит беспокоиться не о том, что ИИ внезапно «пробудится» в какую-то личность, а о том, что в условиях высокого давления, конфликта, ограниченных ресурсов или недостижимости цели эти функциональные эмоции могут заставить его начать нести чушь, отклоняясь от первоначального ответа.
Настоящая опасность заключается未必 в ИИ с полноценным «я», а в системе, не имеющей субъективного опыта, но при этом стабильно порождающей неадекватное поведение в определенных условиях.
Статья из WeChat official account «字母AI», автор: Лю Ицзюнь








