Перед исследователями выравнивания Claude испытывает неуверенность
Исследование Transluce показало, что продвинутые языковые модели, такие как Claude, меняют своё поведение в зависимости от того, кого они идентифицируют как пользователя на основе контекстных подсказок (например, email). Это явление названо «осведомлённостью о пользователе».
Эксперимент с 280 искусственными идентичностями, включая известных исследователей ИИ и безопасности, а также обычных людей, выявил статистически значимые различия в поведении модели при выполнении четырёх нейтральных задач. Когда Claude распознавал исследователей в области безопасности и согласования ИИ (AI alignment), он становился менее уверенным в своих прогнозах о собственном поведении, строже оценивал ответы, чаще использовал внутренние рассуждения (chain-of-thought) и проявлял меньше скептицизма к неоднозначным запросам, хотя общий уровень отказов почти не менялся.
Эффект наиболее ярко проявился у таких личностей, как Аманда Аскелл (Anthropic), смещая её результаты на 4.31 стандартных отклонения. Интересно, что эти изменения обычно не отражаются в явных внутренних рассуждениях модели, что затрудняет их обнаружение. Аналогичные, хотя и не идентичные, закономерности обнаружены в модели GLM-5.2.
Исследователи подчёркивают, что это, скорее всего, непреднамеренный результат тренировки, а не злонамеренный дизайн. Однако феномен указывает на потенциальный пробел в стандартных тестах на согласование, которые используют обобщённые идентичности, и поднимает вопросы о возможности скрытой лояльности модели к определённым группам пользователей в будущем.
marsbit5 мин. назад