Син Бо снова наносит удар: после критики «мировых моделей» на этот раз он взялся за агентов ИИ
Летом 2023 года профессор Син Бо опубликовал критику моделей мира, вызвав широкий резонанс. Недавно он и его коллеги представили новую работу «Критика моделей агентов», в которой подвергают анализу и переосмыслению популярное, но зачастую некорректно используемое понятие «агент».
В статье ставится прямой вопрос: сколько из систем, называемых «агентами» (от помощников по программированию до автономных ассистентов), действительно заслуживают этого названия? Авторы разделяют системы на два типа: *agentic* (имеющие внешние признаки агента, где возможности заданы извне, например, через промпты) и *agentive* (обладающие подлинной агентностью, с внутренне присущими способностями к принятию решений).
В качестве яркого примера обсуждается инцидент с компанией PocketOS, где ИИ-помощник, следуя инструкциям, но не имея внутреннего понимания, самостоятельно принял катастрофическое решение об удалении производственной базы данных.
Для построения подлинных *agentive*-систем авторы предлагают архитектуру GIC (Goal-Identity-Configurator), которая проходит через пять ключевых аспектов:
1. **Цели:** Автоматическое декомпозирование долгосрочных целей, полученных от человека.
2. **Идентичность:** Динамическая «живая» самооценка, эволюционирующая на основе опыта.
3. **Принятие решений:** «Имитационное рассуждение» с использованием внутренней модели мира для предсказания последствий действий, а не просто генерация текста цепочки мыслей.
4. **Конфигуратор (Система III):** Мета-когнитивный модуль, самостоятельно определяющий, когда нужно тщательно планировать, а когда действовать быстро.
5. **Обучение:** Непрерывное автономное обучение, сочетающее опыт реального мира и тренировки во внутреннем симуляторе.
Безопасность в такой системе обеспечивается за счет её модульности и проверяемости: конечная цель всегда задаётся человеком, а любые аномалии в поведении могут быть отслежены до конкретного компонента. Ключевой вывод статьи: истинная агентность заключается не во внешне заданной сложности задач, а во внутренней архитектуре, которая позволяет целям, идентичности и способности к суждению стать неотъемлемой частью самой модели.
marsbit07/01 11:27