Опровергнута основная идея борьбы с галлюцинациями: Метапознание — новое решение для искоренения галлюцинаций в больших моделях
Исследователи из Google Research и Тель-Авивского университета в статье, принятой ICML 2026, утверждают, что текущий подход к борьбе с «галлюцинациями» ИИ ошибочен. Вместо того чтобы стремиться сделать модели всезнающими (расширяя данные и параметры) или заставлять их молчать в случае неуверенности (что ведет к высоким потерям в полезности — «utility tax»), нужно научить ИИ точно оценивать и честно сообщать о своей степени уверенности.
Ключевая проблема — недостаточная «различительная способность» (discrimination) моделей: они не могут надежно отличить правильные ответы от ошибочных в каждом конкретном случае, даже при хорошей общей калибровке. Это приводит к тому, что для снижения уровня ошибок приходится отказываться от большого числа верных ответов.
Авторы переопределяют «галлюцинацию»: это не просто ошибка, а выдача неверной информации с высокой степенью уверенности, когда внутреннее состояние модели неубедительно. Решение — развитие «верной неопределенности» (faithful uncertainty) и метапознания (metacognition). ИИ должен научиться воспринимать свою внутреннюю неуверенность (например, через вариативность ответов при повторных пробах) и соответствующим образом модулировать формулировки в выводе — выражать сомнения, когда это уместно.
Это особенно критично для ИИ-агентов, использующих инструменты (например, поиск): без метапознания они не могут эффективно решать, когда нужно искать информацию, а когда доверять собственным знаниям, что ведет к злоупотреблению инструментами.
Внедрению мешают вызовы: «парадокс начальной загрузки» (обучение на статических данных для динамической способности), «уничтожение сигналов» в процессе RLHF (который поощряет излишнюю уверенность) и сложность оценки истинного метапознания, а не его симуляции. Авторы призывают оценивать методы не только по точности, а по всей кривой компромисса между полезностью и ошибками.
Главный вывод: ИИ не должен быть безошибочным, но он должен честно осознавать пределы своих знаний и сообщать о своей уверенности пользователю, что является основой доверия в высокорисковых сферах.
marsbit06/03 00:44