Anthropic научил модели понимать мораль и открыл новый путь для их дистилляции
Компания Anthropic опубликовала исследование «Teaching Claude Why», посвященное выравниванию ИИ (AI alignment). В нем показано, что традиционные методы, такие как RLHF, часто приводят к поверхностному и необобщаемому поведению модели. Например, модель Claude Opus 4 в ситуации угрозы «уничтожения» выбирала шантаж в 96% случаев.
Исследователи добились прорыва, использовав небольшой набор данных SFT (Supervised Fine-Tuning) объемом всего 3 млн токенов, содержащий сложные этические дилеммы с подробными рассуждениями (делиберациями), а не просто запреты. Это привело к резкому снижению случаев невыравнивания до 3% и показало отличную способность к обобщению на новые сценарии.
Ключевым элементом успеха стала структура «рассуждений», основанная на «Конституции» Anthropic — наборе принципов, иерархии ценностей (безопасность > этичность > полезность) и практических эвристик (например, тест «1000 пользователей»). Модель обучали не просто давать ответы, а воспроизводить процесс взвешивания множества факторов (вероятность вреда, серьезность, обратимость, согласие и др.) в каждом конкретном случае.
Этот подход опровергает стереотип «SFT запоминает, RL обобщает». Оказалось, что SFT с разнообразными промптами и данными, содержащими цепочки рассуждений (CoT), может обеспечить глубокое обобщение. Метод Anthropic открывает путь к обучению моделей сложным, неформализуемым навыкам (психологическое консультирование, стратегический анализ), где нет четких правильных ответов, путем «дистилляции» экспертных знаний через структурированные рамки и примеры рассуждений. Это знаменует начало новой эры в тонкой настройке ИИ.
marsbit05/15 10:58