Oxford и NUS предлагают направление для моделей мира следующего поколения: представлена модель ментального мира

marsbitОпубликовано 2026-08-13Обновлено 2026-08-13

Введение

Оксфордский университет и Национальный университет Сингапура представили новое исследование «Mental World Modeling» (MWM), предлагающее формальную основу для моделирования мира, которая включает как физические, так и ментальные переменные. Традиционные мировые модели, ориентированные только на физическую среду, часто дают «физически правдоподобные, но поведенчески ошибочные» прогнозы, поскольку не учитывают убеждения, цели, эмоции и социальные аспекты, определяющие человеческие решения. MWM рассматривает связанное физико-ментальное состояние мира, моделируя, как агент воспринимает ситуацию (на основе своих знаний и убеждений) и как его действия влияют как на физический мир, так и на ментально-социальную конфигурацию. Для проверки предложен эталонный модульный и не требующий обучения программный фреймворк MENTIS, который выполняет явное поэтапное моделирование: анализ состояния, генерацию наблюдений для целевого агента, декомпозицию действий, симуляцию их влияния на физические и ментальные состояния и оценку вариантов. Эксперименты с использованием нескольких крупных языковых моделей показали, что явное моделирование ментального мира (полная конфигурация MWM) значительно повышает точность прогнозирования человеческих решений, особенно в социальных сценариях. Наибольший выигрыш наблюдался в ситуациях межличностного взаимодействия. Диагностика определила, что основной текущий недостаток системы заключается в моделировании переходов состояний — способности точно предсказывать и...

Представьте себе такую ситуацию: чашка помещена в шкаф человеком А, а человек В этого не видел.

Вопрос: Где человек В будет искать чашку в следующий раз?

Если модель мира знает только физические факты, она ошибочно предсказывает решение В: «Чашка сейчас в шкафу, поэтому нужно идти к шкафу». (Сверху)

Но модель, которая также понимает ментальные состояния людей, может правильно предсказать: «В не знает, что чашку переместили, поэтому думает, что она всё ещё на столе и, скорее всего, вернётся к столу, чтобы её найти». (Снизу)

Следующее состояние мира также определяется ментальными переменными

Это выявляет ключевую проблему: модели мира, которые отслеживают только объекты, их местоположение и движение, могут делать предсказания, которые являются «физически правдоподобными, но поведенчески ошибочными».

Недавно исследовательская группа Оксфордского университета и Национального университета Сингапура в своей новой работе «Mental World Modeling» предложила общую структуру — моделирование ментального мира (Mental World Modeling, MWM). Эта работа включает сами ментальные переменные в состояние мира (world state), а не рассматривает их просто как постфактумные объяснения (post-hoc explanations).

  • Название статьи: Mental World Modeling
  • Ссылка на статью: https://arxiv.org/abs/2607.27201
  • Домашняя страница проекта: https://mental-world.github.io/
  • Открытый исходный код: https://github.com/mental-world/Mentis

На момент публикации MWM заняла первое место в ежедневном рейтинге Hugging Face Daily Papers.

Hugging Face Paper: https://huggingface.co/papers/2607.27201

Недостающая половина модели мира

Большинство существующих моделей мира в основном сосредоточены на физическом аспекте мира:

  • Какие объекты и агенты существуют?
  • Где они находятся?
  • Как будет развиваться видимая сцена?

В этих моделях человек часто является просто движущимся объектом, выполняющим действия, его внутреннее состояние по-настоящему не входит в модель мира. Но в реальном мире люди — не просто движущиеся объекты.

Для интеллекта, ориентированного на человека (human-centered intelligence), этого далеко не достаточно.

Почему? Потому что поведенческие решения человека определяются не только внешней средой, состоящей из объектов, пространственных структур и физических законов, а являются результатом взаимодействия внешней среды и внутренних ментально-социальных переменных.

Например, сервисному роботу необходимо определить, чувствует ли пользователь замешательство, теряет ли терпение или косвенно ищет помощи; медицинскому помощнику нужно учитывать когнитивные способности пациента, восприятие риска, чувство страха и уровень доверия; кооперативный агент должен распознавать: некоторые действия, хотя и физически выполнимы, могут быть неуместными из-за социальных норм, ролевых отношений или контекста межличностного взаимодействия.

Все эти сценарии требуют от интеллектуальных систем способности постоянно отслеживать ментальные и социальные состояния агентов, включая: что они знают, во что верят, на что обращают внимание, чего хотят, что намереваются делать, что чувствуют, а также какие действия считаются социально допустимыми. Даже если две сцены физически идентичны, но убеждения, цели, эмоции, межличностные отношения или социальные обязанности людей в них различны, это может привести к совершенно разному поведению.

Подводя итог: модель мира, даже если она точно воссоздаёт физическую сцену, всё равно может неверно предсказывать поведение человека.

Когнитивная наука уже изучает эти способности с помощью таких теорий, как ментальные модели (mental models), теория сознания (Theory of Mind, ToM), модель агента BDI (Belief–Desire–Intention agency) и воплощённое познание (embodied cognition).

Однако в большинстве современных исследований искусственного интеллекта либо создаются модели физического мира, лишённые ментальных состояний, либо психологические рассуждения упрощаются до изолированных вопросов теории сознания (Theory-of-Mind question answering).

Оба этих подхода недостаточны для описания по-настоящему целостного мира — потому что следующее состояние мира определяется не только физическими факторами, а совместной эволюцией физического и ментального состояния (jointly physical and mental).

Как же по-настоящему включить ментальные переменные в пространство состояний модели мира?

Это исследование пытается предложить формализованную структуру моделирования ментального мира для построения моделей мира, способных одновременно представлять как физическую, так и ментальную динамику.

Цель моделирования ментального мира — не симулировать чьё-либо личное субъективное сознание и опыт, а построить внешний, приблизительный, связанный с задачей симулятор мира (task-relevant world simulator). Глобальное состояние этого симулятора включает в себя как физические переменные (physical variables), так и ментальные переменные (mental variables).

Два субъекта, три операционных модуля, одно физически-ментально связанное состояние. Модель ментального мира как глобальный симулятор сначала генерирует информацию, которую целевой агент может видеть и выводить, а затем агент действует на основе этого восприятия.

Во-первых, моделирование ментального мира поддерживает связанное физически-ментальное состояние мира (coupled physical–mental world state), то есть одновременно представляет физическую среду и скрытые ментальные состояния агентов.

Во-вторых, целевой агент (target agent) может наблюдать только частичное, преобразованное, представленное от первого лица отображение этого глобального состояния (partial, first-person rendering). Для каждого целевого агента (target agent) MWM генерирует локальную перспективу наблюдения — то, что этот человек действительно может видеть, слышать, знать и выводить.

Затем целевой агент действует на основе этого наблюдения, а модель мира симулирует, как это действие одновременно изменит:

  1. Объективную сцену в физическом мире;
  2. Конфигурацию состояний в ментально-социальном мире (mental-social configuration).

Как проверить эффективность MWM?

Чтобы сделать эту структуру проверяемой, команда реализовала модульную референсную систему MENTIS — систему-эталон, не требующую обучения и полностью наблюдаемую, которая заставляет системы на основе больших языковых моделей (LLM) рассуждать в соответствии с моделью ментального мира.

Процесс MENTIS.

Сначала система преобразует входную сцену в структурированное текущее состояние

Генерирует наблюдение целевого псевдоагента

, анализирует каждый вариант-кандидат как ветвь поведения, параллельно симулирует последующие изменения физического и ментального состояния и, наконец, оценивает различные будущие результаты и выбирает окончательное поведение.

При задании контекстной сцены, целевого агента и набора возможных действий MENTIS разбивает процесс прогнозирования решения на ряд явных этапов: анализ состояния → генерация целевого наблюдения → декомпозиция поведения → симуляция перехода связанного физически-ментального состояния → оценка на уровне ветвей → окончательное решение.

  • Сначала она анализирует сцену как физически-ментальное состояние с типовой структурой;
  • Затем генерирует из этого состояния локальное наблюдение, доступное целевому агенту;
  • Далее декомпозирует каждое возможное действие на соответствующие ему физические и ментальные воздействия;
  • Потом симулирует для каждой возможной ветви поведения связанное физически-ментальное следующее состояние;
  • Наконец, оценивает каждую ветвь по трём измерениям: физическая правдоподобность, ментальная согласованность и социальная нормативность, и выбирает окончательное поведение с помощью детерминированных правил.

Другими словами, MENTIS больше не позволяет модели напрямую перескакивать от сцены к предсказанию поведения, а требует явного моделирования: в каком состоянии находится мир, как целевой агент воспринимает мир, как различные действия изменят физическое и ментальное состояние, и какое поведение наиболее правдоподобно с физической и социальной точек зрения.

MENTIS не требует обучения, поэтому её результаты отражают способность к рассуждениям, привнесённую самой структурой модели, а не зависимость от подобранных параметров. Каждый этап системы выводит промежуточные результаты, которые могут быть проверены машиной, поэтому состояния, наблюдения и симулированное будущее могут быть записаны, сравнены с ручной аннотацией или непосредственно заменены на реальные аннотированные значения для анализа.

Действительно ли MWM эффективна, и в чём её узкие места?

Исследователи разработали серию экспериментов, специально тестирующих возможные точки отказа этой структуры. Результаты экспериментов показывают последовательную закономерность.

Во-первых, явное моделирование ментального мира необходимо для прогнозирования человеческих решений.

Лестница необходимости (F1 окончательного поведения, 448 записей). (a) F1-оценки восьми моделей мира на разных этапах лестницы (тонкие линии — результаты отдельных моделей, толстые линии — усреднённые результаты). (b) Результаты абляционных экспериментов S6 на восьми моделях (белые точки — соответствующие значения для каждой модели).

Среди 8 протестированных моделей мира на основе больших языковых моделей (LLM) средний F1 при прямом ответе составил 63,3; полная конфигурация MWM показала наилучший результат — 87,9; удаление ментального канала привело к снижению производительности всех моделей примерно на 12,1 пункта, удаление физического канала — на 16,5 пункта, раздельное предсказание переходов двух состояний также снизило результат на 6,4 пункта.

Показатели F1 четырёх экспериментальных установок в разных категориях сцен

Причём наибольший прирост производительности наблюдался именно в сценариях межличностного взаимодействия, потому что решения в них в основном зависят от скрытых ментальных переменных. Для gpt-5.6-sol полный MWM повысил F1 окончательного действия с 66,5 при прямом ответе до 92,9, увеличив на 26,4 пункта. Этот результат относится только к контролируемому тестированию в статье, но он согласуется с исследовательской мотивацией: когда убеждения, роли и отношения определяют следующий шаг, физические переменные не могут самостоятельно объяснить действие.

Так в чём же заключается истинное узкое место?

Помимо доказательства необходимости, в статье была проведена более целенаправленная диагностика: замена определённого промежуточного шага на правильную информацию (интервенция Oracle) с последующим измерением, насколько улучшится итоговый прогноз, что позволяет дополнительно определить источник расхождения между моделью и человеком.

Эксперименты с интервенцией Oracle (gpt-5.6-sol). F1-оценка окончательного поведения после замены прогноза модели на реальную аннотированную информацию на одном или нескольких этапах; метки на столбцах показывают прирост производительности по сравнению с полной прогнозирующей версией S6.

Результаты эксперимента показывают, что для gpt-5.6-sol полный MWM дал 90,7, а использование аннотированной реальной передачи состояния позволило повысить до 94,2, что дало прирост производительности на +3,5 — это наибольший единичный прирост. Только интервенция в передачу состояния позволила модели компенсировать 45% разрыва с человеческой производительностью (7,8 балла).

Результаты показывают, что самым большим оставшимся узким местом является симуляция перехода состояний, то есть недостаточная способность модели предсказывать, как будет изменяться связанный физически-ментальный мир. Это даёт чёткое направление для будущего улучшения систем MWM.

Когда моделирование ментального мира наиболее полезно

Ценность MWM не следует измерять по тому, «сколько социальных областей она может охватить». В конце концов, практически все системы, ориентированные на человека, в широком смысле обладают некоторой «социальностью».

Более точным и значимым критерием является:

MWM имеет истинную ценность тогда, когда эффективность действия зависит от переменных, которые нельзя вывести только из физической сцены, но которые определяют, как человек воспринимает, выбирает, принимает, сопротивляется или учится.

С точки зрения теории принятия решений, ценность информации о ментальном состоянии можно определить как:

Ожидаемый разрыв полезности (expected utility gap) между оптимальным вмешательством, выбранным при наличии информации о связанном физически-ментальном состоянии, и оптимальным вмешательством, выбранным только на основе физического состояния.

Этот разрыв будет очень значительным, когда убеждения, цели, внимание, доверие, обязательства, эмоциональные состояния или социальные нормы изменяют то, «какое действие является полезным»; и очень маленьким, когда следующий шаг почти полностью определяется физической осуществимостью.

Например, контроллеру механического захвата не нужен MWM для выполнения действия «протянуть руку и взять чашку»; но домашнему сервисному роботу при принятии решения «передавать ли эту чашку хозяину» необходимо понимать стоящие за этим ментальные и социальные состояния — является ли это действие оказанием помощи, помехой, проявлением бестактности, созданием риска или передачей ложной информации.

Итог

В этой работе предложена формализованная структура моделирования ментального мира для построения моделей мира, способных одновременно представлять физическую и ментальную динамику. Её основные вклады можно свести к трём пунктам:

Предложение моделирования ментального мира: формализованная математическая структура, объединяющая физическую и ментальную динамику в единой перспективе моделирования мира, позволяющая системам ИИ не только рассуждать об изменениях среды, но и понимать, как агенты воспринимают, интерпретируют и реагируют на эти изменения на ментальном уровне.

Предложение MENTIS: реализация-эталон, не требующая обучения, которая конкретизирует и делает работоспособной структуру MWM через такие модули, как анализ состояния, генерация наблюдений, декомпозиция поведения, передача связанного физически-ментального состояния и оценка ценности на уровне ветвей.

Проведение систематического эмпирического исследования, результаты которого сводятся к двум основным выводам:

Явное моделирование ментального мира необходимо для прогнозирования человеческих решений, особенно в сценариях социального взаимодействия и межличностных отношений;

Ключевым узким местом текущих систем MWM является недостаточная способность к симуляции передачи состояний, что также указывает направление для будущих исследований и улучшений.

Эта статья взята из WeChat официального аккаунта «机器之心» («Машинное сердце»)

Связанные с этим вопросы

QЧто такое ментальное моделирование мира (MWM), предложенное исследователями из Оксфорда и NUS?

AМентальное моделирование мира (Mental World Modeling, MWM) — это формальный фреймворк для построения мировых моделей, которые одновременно представляют физическую и ментальную динамику. Он включает ментальные переменные (например, убеждения, цели, эмоции) в состояние мира наравне с физическими переменными, что позволяет более точно предсказывать поведение людей в социальных взаимодействиях.

QКак работает система MENTIS, реализующая концепцию MWM?

AMENTIS — это модульная эталонная система, которая реализует MWM без обучения. Она разбивает процесс предсказания решения на явные этапы: анализ состояния (физико-ментального), генерация локального наблюдения для целевого агента, декомпозиция действий, симуляция совместного перехода физического и ментального состояния, оценка вариантов и финальный выбор. Это позволяет прозрачно моделировать, как агент воспринимает мир и как его действия меняют и физическую, и ментальную реальность.

QКакой главный вывод эмпирического исследования, описанного в статье?

AЭмпирическое исследование показывает два ключевых вывода: 1) Явное ментальное моделирование мира необходимо для точного предсказания человеческих решений, особенно в сценариях социального взаимодействия. 2) Основное текущее ограничение систем MWM — недостаточная способность к симуляции перехода состояний (state transition), то есть точному прогнозированию того, как совместное физико-ментальное состояние мира изменится в результате действий.

QВ каких сценариях ментальное моделирование мира (MWM) имеет наибольшую ценность?

AMWM наиболее ценно в ситуациях, где эффективность действия зависит от переменных, которые нельзя вывести только из физической сцены, но которые определяют, как люди воспринимают, выбирают или реагируют. Например, в социальных взаимодействиях, где важны убеждения, доверие, социальные нормы, роли или эмоции. В чисто физических задачах (например, захват объекта) ценность MWM невелика.

QКакой пример из статьи иллюстрирует проблему чисто физической мировой модели?

AВ статье приведён пример: Чашку кладут в шкаф, а человек Б этого не видит. Физическая модель мира, зная, что чашка теперь в шкафу, предскажет, что Б пойдёт искать её туда. Однако ментальная модель, учитывающая убеждения Б («он считает, что чашка всё ещё на столе»), правильно предскажет, что Б вернётся к столу. Это показывает, что модели, отслеживающие только физические объекты, могут давать «физически корректные, но поведенчески ошибочные» прогнозы.

Похожее

Оценки криптовалют могут удвоиться, поскольку протоколы связывают выручку с токенами: CIO Bitwise

По словам Мэтта Хоугана, инвестиционного директора Bitwise, оценка криптоактивов может как минимум удвоиться по мере того, как протоколы всё чаще используют доходы для выкупа и сжигания собственных токенов. Он отметил, что рынок криптовалют за пределами биткойна становится ориентированным на выручку, где активность сети напрямую влияет на стоимость нативных токенов, и это изменение ещё не учтено инвесторами, что оставляет некоторые активы недооцененными. Хоуган привёл в пример протоколы Hyperliquid, Uniswap, Aave, Pump.fun и Lighter, которые используют комиссии для выкупа или изъятия токенов из обращения. Он ожидает, что в следующие 12-24 месяца аналогичные механизмы монетизации внедрят другие приложения децентрализованных финансов (DeFi) и сети первого уровня. Это создаст более прочную связь между доходом протокола и стоимостью токена, предоставив инвесторам более привычные метрики оценки. Например, биржа Hyperliquid направила 99% своей выручки за прошлый год, превышающей $800 млн, на выкуп и сжигание токена HYPE. Uniswap после ребрендинга "UNIfication" активирует сбор комиссий протокола для финансирования сжигания UNI с декабря 2025 года. Aave DAO также реализует программу выкупа токенов, а её основатель заявил, что 100% доходов протокола и стейблкоина GHO направляется на поддержку токена AAVE. Хоуган связал этот тренд с более благоприятной регуляторной средой в США, где проекты ранее избегали функций распределения доходов из-за опасений, связанных с законодательством о ценных бумагах.

cointelegraph35 мин. назад

Оценки криптовалют могут удвоиться, поскольку протоколы связывают выручку с токенами: CIO Bitwise

cointelegraph35 мин. назад

Уолл-стрит утренний отчет: CPI мягко вступил в силу, фондовый рынок США показал глубокое V-образное восстановление; облачные технологии на базе ИИ, хранение данных и оптическая связь переживают коллективный взрыв

Ежедневный утренний отчет Wall Street Journal: индекс потребительских цен (CPI) вышел умеренным, фондовый рынок США продемонстрировал сильное восстановление («глубокую V-образную форму»), а сектора AI-облачных технологий, памяти и оптической связи пережили коллективный всплеск. Ключевые данные: ИПЦ США за июль вырос на 0,1% в месячном исчислении и на 3,4% в годовом исчислении, полностью соответствуя ожиданиям. Это, вместе со слабыми данными по занятости на прошлой неделе, снизило рыночные ожидания повышения ставки ФРС в сентябре. Рынки: Индекс S&P 500 вырос на 0,26%, Nasdaq Composite — на 0,54%. Основными движущими силами стали аппаратное обеспечение ИИ, память, оптическая связь и новые облачные вычисления. Золото сохранило силу, серебро выросло примерно на 14% в августе. Цены на нефть снизились после предыдущего роста. Главные темы: Дефицит вычислительных мощностей для ИИ стимулировал взрывной рост в секторах, связанных с инфраструктурой. Индекс полупроводников Philadelphia вырос на 2,49%. Акции поставщиков облачных вычислений (NEBIUS +34,14%, CoreWeave +19,28%), оптической связи (Lumentum +13,63%) и памяти (SK Hynix +9,01%) показали значительный рост. Динамика крупных компаний: NVIDIA выросла на 3,03%. SpaceX выросла на 9,65% после выпуска Grok 4.6. Акции Apple, Google, Meta, Microsoft и Tesla снизились. Контекст и предупреждения: Дефицит федерального бюджета США резко вырос. Агентство IEA предупредило о возможном крупном дефиците поставок нефти. Высокая стоимость страховки войны сдерживает судоходство в Ормузском проливе. Основные события для наблюдения: данные по PPI США за июль (13 августа), день инвестора SanDisk (13 августа), срок подачи отчетов 13F в SEC (14 августа), отчет о прибылях и убытках Applied Materials (14 августа).

marsbit1 ч. назад

Уолл-стрит утренний отчет: CPI мягко вступил в силу, фондовый рынок США показал глубокое V-образное восстановление; облачные технологии на базе ИИ, хранение данных и оптическая связь переживают коллективный взрыв

marsbit1 ч. назад

Загадка, мучившая математическое сообщество 22 года, была решена стажёром из больницы «Сехэ»?

Молодой нейрохирург из Пекинской больницы «Сехэ», Шаньму Цзинь, без формального математического образования, использовал ChatGPT-5.6 для решения знаменитой гипотезы Крузе (Crouzeix conjecture), над которой математики бились 22 года. Искусственный интеллект самостоятельно работал около 16 часов, найдя элегантное доказательство через «стратегию выборки» и условие положительности, что стало неожиданным прорывом. Всего через 8 дней появилось второе, независимое доказательство от других математиков, также созданное с помощью ИИ. Этот случай демонстрирует, как продвинутые ИИ-инструменты ломают барьеры между дисциплинами, ускоряя научные открытия и открывая новую эру в исследовании. Весь процесс, включая промпты и код, был опубликован в открытом доступе.

marsbit1 ч. назад

Загадка, мучившая математическое сообщество 22 года, была решена стажёром из больницы «Сехэ»?

marsbit1 ч. назад

Генеральный директор Metaplanet опроверг слухи о продаже биткоинов после перевода на сумму 322 млн долларов

Генеральный директор Metaplanet Саймон Герович опроверг слухи о продаже биткойнов компанией после перевода 5014 BTC (на сумму 322 миллиона долларов). Он заявил, что это была рутинная операция по хранению, и компания не продавала криптовалюту, сохранив свои активы в размере 43 000 BTC. Комиссия за перевод составила около 8 долларов. Metaplanet, являющаяся третьей по величине публичной компанией-казначеем биткойнов и крупнейшей в Азии, по данным Arkham, имеет нереализованные убытки в размере около 1,4 миллиарда долларов. Компания продолжает развивать свою стратегию, включая создание Metaplanet Ventures с инвестициями в 4 миллиарда иен (25 миллионов долларов) в инфраструктуру биткойна в Японии. Цели компании — владение 100 000 BTC к концу 2026 года и 210 000 BTC к концу 2027 года.

cointelegraph1 ч. назад

Генеральный директор Metaplanet опроверг слухи о продаже биткоинов после перевода на сумму 322 млн долларов

cointelegraph1 ч. назад

Торговля

Спот
活动图片