Oxford и NUS предлагают направление для моделей мира следующего поколения: представлена модель ментального мира

marsbitОпубликовано 2026-08-13Обновлено 2026-08-13

Введение

Оксфордский университет и Национальный университет Сингапура представили новое исследование «Mental World Modeling» (MWM), предлагающее формальную основу для моделирования мира, которая включает как физические, так и ментальные переменные. Традиционные мировые модели, ориентированные только на физическую среду, часто дают «физически правдоподобные, но поведенчески ошибочные» прогнозы, поскольку не учитывают убеждения, цели, эмоции и социальные аспекты, определяющие человеческие решения. MWM рассматривает связанное физико-ментальное состояние мира, моделируя, как агент воспринимает ситуацию (на основе своих знаний и убеждений) и как его действия влияют как на физический мир, так и на ментально-социальную конфигурацию. Для проверки предложен эталонный модульный и не требующий обучения программный фреймворк MENTIS, который выполняет явное поэтапное моделирование: анализ состояния, генерацию наблюдений для целевого агента, декомпозицию действий, симуляцию их влияния на физические и ментальные состояния и оценку вариантов. Эксперименты с использованием нескольких крупных языковых моделей показали, что явное моделирование ментального мира (полная конфигурация MWM) значительно повышает точность прогнозирования человеческих решений, особенно в социальных сценариях. Наибольший выигрыш наблюдался в ситуациях межличностного взаимодействия. Диагностика определила, что основной текущий недостаток системы заключается в моделировании переходов состояний — способности точно предсказывать и...

Представьте себе такую ситуацию: чашка помещена в шкаф человеком А, а человек В этого не видел.

Вопрос: Где человек В будет искать чашку в следующий раз?

Если модель мира знает только физические факты, она ошибочно предсказывает решение В: «Чашка сейчас в шкафу, поэтому нужно идти к шкафу». (Сверху)

Но модель, которая также понимает ментальные состояния людей, может правильно предсказать: «В не знает, что чашку переместили, поэтому думает, что она всё ещё на столе и, скорее всего, вернётся к столу, чтобы её найти». (Снизу)

Следующее состояние мира также определяется ментальными переменными

Это выявляет ключевую проблему: модели мира, которые отслеживают только объекты, их местоположение и движение, могут делать предсказания, которые являются «физически правдоподобными, но поведенчески ошибочными».

Недавно исследовательская группа Оксфордского университета и Национального университета Сингапура в своей новой работе «Mental World Modeling» предложила общую структуру — моделирование ментального мира (Mental World Modeling, MWM). Эта работа включает сами ментальные переменные в состояние мира (world state), а не рассматривает их просто как постфактумные объяснения (post-hoc explanations).

  • Название статьи: Mental World Modeling
  • Ссылка на статью: https://arxiv.org/abs/2607.27201
  • Домашняя страница проекта: https://mental-world.github.io/
  • Открытый исходный код: https://github.com/mental-world/Mentis

На момент публикации MWM заняла первое место в ежедневном рейтинге Hugging Face Daily Papers.

Hugging Face Paper: https://huggingface.co/papers/2607.27201

Недостающая половина модели мира

Большинство существующих моделей мира в основном сосредоточены на физическом аспекте мира:

  • Какие объекты и агенты существуют?
  • Где они находятся?
  • Как будет развиваться видимая сцена?

В этих моделях человек часто является просто движущимся объектом, выполняющим действия, его внутреннее состояние по-настоящему не входит в модель мира. Но в реальном мире люди — не просто движущиеся объекты.

Для интеллекта, ориентированного на человека (human-centered intelligence), этого далеко не достаточно.

Почему? Потому что поведенческие решения человека определяются не только внешней средой, состоящей из объектов, пространственных структур и физических законов, а являются результатом взаимодействия внешней среды и внутренних ментально-социальных переменных.

Например, сервисному роботу необходимо определить, чувствует ли пользователь замешательство, теряет ли терпение или косвенно ищет помощи; медицинскому помощнику нужно учитывать когнитивные способности пациента, восприятие риска, чувство страха и уровень доверия; кооперативный агент должен распознавать: некоторые действия, хотя и физически выполнимы, могут быть неуместными из-за социальных норм, ролевых отношений или контекста межличностного взаимодействия.

Все эти сценарии требуют от интеллектуальных систем способности постоянно отслеживать ментальные и социальные состояния агентов, включая: что они знают, во что верят, на что обращают внимание, чего хотят, что намереваются делать, что чувствуют, а также какие действия считаются социально допустимыми. Даже если две сцены физически идентичны, но убеждения, цели, эмоции, межличностные отношения или социальные обязанности людей в них различны, это может привести к совершенно разному поведению.

Подводя итог: модель мира, даже если она точно воссоздаёт физическую сцену, всё равно может неверно предсказывать поведение человека.

Когнитивная наука уже изучает эти способности с помощью таких теорий, как ментальные модели (mental models), теория сознания (Theory of Mind, ToM), модель агента BDI (Belief–Desire–Intention agency) и воплощённое познание (embodied cognition).

Однако в большинстве современных исследований искусственного интеллекта либо создаются модели физического мира, лишённые ментальных состояний, либо психологические рассуждения упрощаются до изолированных вопросов теории сознания (Theory-of-Mind question answering).

Оба этих подхода недостаточны для описания по-настоящему целостного мира — потому что следующее состояние мира определяется не только физическими факторами, а совместной эволюцией физического и ментального состояния (jointly physical and mental).

Как же по-настоящему включить ментальные переменные в пространство состояний модели мира?

Это исследование пытается предложить формализованную структуру моделирования ментального мира для построения моделей мира, способных одновременно представлять как физическую, так и ментальную динамику.

Цель моделирования ментального мира — не симулировать чьё-либо личное субъективное сознание и опыт, а построить внешний, приблизительный, связанный с задачей симулятор мира (task-relevant world simulator). Глобальное состояние этого симулятора включает в себя как физические переменные (physical variables), так и ментальные переменные (mental variables).

Два субъекта, три операционных модуля, одно физически-ментально связанное состояние. Модель ментального мира как глобальный симулятор сначала генерирует информацию, которую целевой агент может видеть и выводить, а затем агент действует на основе этого восприятия.

Во-первых, моделирование ментального мира поддерживает связанное физически-ментальное состояние мира (coupled physical–mental world state), то есть одновременно представляет физическую среду и скрытые ментальные состояния агентов.

Во-вторых, целевой агент (target agent) может наблюдать только частичное, преобразованное, представленное от первого лица отображение этого глобального состояния (partial, first-person rendering). Для каждого целевого агента (target agent) MWM генерирует локальную перспективу наблюдения — то, что этот человек действительно может видеть, слышать, знать и выводить.

Затем целевой агент действует на основе этого наблюдения, а модель мира симулирует, как это действие одновременно изменит:

  1. Объективную сцену в физическом мире;
  2. Конфигурацию состояний в ментально-социальном мире (mental-social configuration).

Как проверить эффективность MWM?

Чтобы сделать эту структуру проверяемой, команда реализовала модульную референсную систему MENTIS — систему-эталон, не требующую обучения и полностью наблюдаемую, которая заставляет системы на основе больших языковых моделей (LLM) рассуждать в соответствии с моделью ментального мира.

Процесс MENTIS.

Сначала система преобразует входную сцену в структурированное текущее состояние

Генерирует наблюдение целевого псевдоагента

, анализирует каждый вариант-кандидат как ветвь поведения, параллельно симулирует последующие изменения физического и ментального состояния и, наконец, оценивает различные будущие результаты и выбирает окончательное поведение.

При задании контекстной сцены, целевого агента и набора возможных действий MENTIS разбивает процесс прогнозирования решения на ряд явных этапов: анализ состояния → генерация целевого наблюдения → декомпозиция поведения → симуляция перехода связанного физически-ментального состояния → оценка на уровне ветвей → окончательное решение.

  • Сначала она анализирует сцену как физически-ментальное состояние с типовой структурой;
  • Затем генерирует из этого состояния локальное наблюдение, доступное целевому агенту;
  • Далее декомпозирует каждое возможное действие на соответствующие ему физические и ментальные воздействия;
  • Потом симулирует для каждой возможной ветви поведения связанное физически-ментальное следующее состояние;
  • Наконец, оценивает каждую ветвь по трём измерениям: физическая правдоподобность, ментальная согласованность и социальная нормативность, и выбирает окончательное поведение с помощью детерминированных правил.

Другими словами, MENTIS больше не позволяет модели напрямую перескакивать от сцены к предсказанию поведения, а требует явного моделирования: в каком состоянии находится мир, как целевой агент воспринимает мир, как различные действия изменят физическое и ментальное состояние, и какое поведение наиболее правдоподобно с физической и социальной точек зрения.

MENTIS не требует обучения, поэтому её результаты отражают способность к рассуждениям, привнесённую самой структурой модели, а не зависимость от подобранных параметров. Каждый этап системы выводит промежуточные результаты, которые могут быть проверены машиной, поэтому состояния, наблюдения и симулированное будущее могут быть записаны, сравнены с ручной аннотацией или непосредственно заменены на реальные аннотированные значения для анализа.

Действительно ли MWM эффективна, и в чём её узкие места?

Исследователи разработали серию экспериментов, специально тестирующих возможные точки отказа этой структуры. Результаты экспериментов показывают последовательную закономерность.

Во-первых, явное моделирование ментального мира необходимо для прогнозирования человеческих решений.

Лестница необходимости (F1 окончательного поведения, 448 записей). (a) F1-оценки восьми моделей мира на разных этапах лестницы (тонкие линии — результаты отдельных моделей, толстые линии — усреднённые результаты). (b) Результаты абляционных экспериментов S6 на восьми моделях (белые точки — соответствующие значения для каждой модели).

Среди 8 протестированных моделей мира на основе больших языковых моделей (LLM) средний F1 при прямом ответе составил 63,3; полная конфигурация MWM показала наилучший результат — 87,9; удаление ментального канала привело к снижению производительности всех моделей примерно на 12,1 пункта, удаление физического канала — на 16,5 пункта, раздельное предсказание переходов двух состояний также снизило результат на 6,4 пункта.

Показатели F1 четырёх экспериментальных установок в разных категориях сцен

Причём наибольший прирост производительности наблюдался именно в сценариях межличностного взаимодействия, потому что решения в них в основном зависят от скрытых ментальных переменных. Для gpt-5.6-sol полный MWM повысил F1 окончательного действия с 66,5 при прямом ответе до 92,9, увеличив на 26,4 пункта. Этот результат относится только к контролируемому тестированию в статье, но он согласуется с исследовательской мотивацией: когда убеждения, роли и отношения определяют следующий шаг, физические переменные не могут самостоятельно объяснить действие.

Так в чём же заключается истинное узкое место?

Помимо доказательства необходимости, в статье была проведена более целенаправленная диагностика: замена определённого промежуточного шага на правильную информацию (интервенция Oracle) с последующим измерением, насколько улучшится итоговый прогноз, что позволяет дополнительно определить источник расхождения между моделью и человеком.

Эксперименты с интервенцией Oracle (gpt-5.6-sol). F1-оценка окончательного поведения после замены прогноза модели на реальную аннотированную информацию на одном или нескольких этапах; метки на столбцах показывают прирост производительности по сравнению с полной прогнозирующей версией S6.

Результаты эксперимента показывают, что для gpt-5.6-sol полный MWM дал 90,7, а использование аннотированной реальной передачи состояния позволило повысить до 94,2, что дало прирост производительности на +3,5 — это наибольший единичный прирост. Только интервенция в передачу состояния позволила модели компенсировать 45% разрыва с человеческой производительностью (7,8 балла).

Результаты показывают, что самым большим оставшимся узким местом является симуляция перехода состояний, то есть недостаточная способность модели предсказывать, как будет изменяться связанный физически-ментальный мир. Это даёт чёткое направление для будущего улучшения систем MWM.

Когда моделирование ментального мира наиболее полезно

Ценность MWM не следует измерять по тому, «сколько социальных областей она может охватить». В конце концов, практически все системы, ориентированные на человека, в широком смысле обладают некоторой «социальностью».

Более точным и значимым критерием является:

MWM имеет истинную ценность тогда, когда эффективность действия зависит от переменных, которые нельзя вывести только из физической сцены, но которые определяют, как человек воспринимает, выбирает, принимает, сопротивляется или учится.

С точки зрения теории принятия решений, ценность информации о ментальном состоянии можно определить как:

Ожидаемый разрыв полезности (expected utility gap) между оптимальным вмешательством, выбранным при наличии информации о связанном физически-ментальном состоянии, и оптимальным вмешательством, выбранным только на основе физического состояния.

Этот разрыв будет очень значительным, когда убеждения, цели, внимание, доверие, обязательства, эмоциональные состояния или социальные нормы изменяют то, «какое действие является полезным»; и очень маленьким, когда следующий шаг почти полностью определяется физической осуществимостью.

Например, контроллеру механического захвата не нужен MWM для выполнения действия «протянуть руку и взять чашку»; но домашнему сервисному роботу при принятии решения «передавать ли эту чашку хозяину» необходимо понимать стоящие за этим ментальные и социальные состояния — является ли это действие оказанием помощи, помехой, проявлением бестактности, созданием риска или передачей ложной информации.

Итог

В этой работе предложена формализованная структура моделирования ментального мира для построения моделей мира, способных одновременно представлять физическую и ментальную динамику. Её основные вклады можно свести к трём пунктам:

Предложение моделирования ментального мира: формализованная математическая структура, объединяющая физическую и ментальную динамику в единой перспективе моделирования мира, позволяющая системам ИИ не только рассуждать об изменениях среды, но и понимать, как агенты воспринимают, интерпретируют и реагируют на эти изменения на ментальном уровне.

Предложение MENTIS: реализация-эталон, не требующая обучения, которая конкретизирует и делает работоспособной структуру MWM через такие модули, как анализ состояния, генерация наблюдений, декомпозиция поведения, передача связанного физически-ментального состояния и оценка ценности на уровне ветвей.

Проведение систематического эмпирического исследования, результаты которого сводятся к двум основным выводам:

Явное моделирование ментального мира необходимо для прогнозирования человеческих решений, особенно в сценариях социального взаимодействия и межличностных отношений;

Ключевым узким местом текущих систем MWM является недостаточная способность к симуляции передачи состояний, что также указывает направление для будущих исследований и улучшений.

Эта статья взята из WeChat официального аккаунта «机器之心» («Машинное сердце»)

Связанные с этим вопросы

QЧто такое ментальное моделирование мира (MWM), предложенное исследователями из Оксфорда и NUS?

AМентальное моделирование мира (Mental World Modeling, MWM) — это формальный фреймворк для построения мировых моделей, которые одновременно представляют физическую и ментальную динамику. Он включает ментальные переменные (например, убеждения, цели, эмоции) в состояние мира наравне с физическими переменными, что позволяет более точно предсказывать поведение людей в социальных взаимодействиях.

QКак работает система MENTIS, реализующая концепцию MWM?

AMENTIS — это модульная эталонная система, которая реализует MWM без обучения. Она разбивает процесс предсказания решения на явные этапы: анализ состояния (физико-ментального), генерация локального наблюдения для целевого агента, декомпозиция действий, симуляция совместного перехода физического и ментального состояния, оценка вариантов и финальный выбор. Это позволяет прозрачно моделировать, как агент воспринимает мир и как его действия меняют и физическую, и ментальную реальность.

QКакой главный вывод эмпирического исследования, описанного в статье?

AЭмпирическое исследование показывает два ключевых вывода: 1) Явное ментальное моделирование мира необходимо для точного предсказания человеческих решений, особенно в сценариях социального взаимодействия. 2) Основное текущее ограничение систем MWM — недостаточная способность к симуляции перехода состояний (state transition), то есть точному прогнозированию того, как совместное физико-ментальное состояние мира изменится в результате действий.

QВ каких сценариях ментальное моделирование мира (MWM) имеет наибольшую ценность?

AMWM наиболее ценно в ситуациях, где эффективность действия зависит от переменных, которые нельзя вывести только из физической сцены, но которые определяют, как люди воспринимают, выбирают или реагируют. Например, в социальных взаимодействиях, где важны убеждения, доверие, социальные нормы, роли или эмоции. В чисто физических задачах (например, захват объекта) ценность MWM невелика.

QКакой пример из статьи иллюстрирует проблему чисто физической мировой модели?

AВ статье приведён пример: Чашку кладут в шкаф, а человек Б этого не видит. Физическая модель мира, зная, что чашка теперь в шкафу, предскажет, что Б пойдёт искать её туда. Однако ментальная модель, учитывающая убеждения Б («он считает, что чашка всё ещё на столе»), правильно предскажет, что Б вернётся к столу. Это показывает, что модели, отслеживающие только физические объекты, могут давать «физически корректные, но поведенчески ошибочные» прогнозы.

Похожее

Почему NeoCloud показал наибольший рост во время текущего восстановления технологических акций США?

В этом раунде восстановления американских технологических акций, NeoCloud (представленный такими компаниями, как CoreWeave и Nebius) показал самый значительный рост. Основная причина в том, что рынок переоценивает его роль как поставщика ключевой инфраструктуры для ИИ. NeoCloud предлагает не просто аренду GPU, а готовые к работе «фабрики вычислений» — мощности, включающие GPU, центры обработки данных, доступ к электричеству, сети и обслуживание, которые можно быстро развернуть. Ключевым фактором роста стала видимость будущих доходов благодаря долгосрочным контрактам с клиентами на ИИ, часто с минимальными гарантированными платежами. Это снижает риски, облегчает привлечение финансирования для расширения и создает эффект «маховика»: контракты → финансирование → новые мощности → рост выручки. В отличие от производителей чипов и памяти, где рынок опасается циклических спадов, или крупных облачных провайдеров (Azure, AWS, Google Cloud), где влияние ИИ-заказов размыто, NeoCloud обладает высокой «рычаговостью». Его относительно небольшая база выручки, чистая экспозиция к ИИ и быстрый рост контрактного портфеля делают его высокоэластичным активом. Рост основан на сочетании операционного, финансового и акционерного рычагов. Особое внимание рынка сейчас сосредоточено на дефицитном ресурсе — мощности электроснабжения. Способность NeoCloud обеспечивать и быстро подключать электричество для дата-центров становится критическим конкурентным преимуществом, возможно, более важным, чем доступ к самим GPU. Таким образом, лидерство NeoCloud отражает сдвиг в восприятии рынка: наибольшую премию получают не просто поставщики компонентов, а операторы, способные быстро превращать稀缺ные ресурсы (электричество, разрешения) в контрактную, приносящую денежный поток, вычислительную мощность. Устойчивость этого тренда будет зависеть от способности компаний выполнять масштабные заказы, превращая их в реальные доходы и денежные потоки.

marsbit1 ч. назад

Почему NeoCloud показал наибольший рост во время текущего восстановления технологических акций США?

marsbit1 ч. назад

Оценки криптовалют могут удвоиться, поскольку протоколы связывают выручку с токенами: CIO Bitwise

По словам Мэтта Хоугана, инвестиционного директора Bitwise, оценка криптоактивов может как минимум удвоиться по мере того, как протоколы всё чаще используют доходы для выкупа и сжигания собственных токенов. Он отметил, что рынок криптовалют за пределами биткойна становится ориентированным на выручку, где активность сети напрямую влияет на стоимость нативных токенов, и это изменение ещё не учтено инвесторами, что оставляет некоторые активы недооцененными. Хоуган привёл в пример протоколы Hyperliquid, Uniswap, Aave, Pump.fun и Lighter, которые используют комиссии для выкупа или изъятия токенов из обращения. Он ожидает, что в следующие 12-24 месяца аналогичные механизмы монетизации внедрят другие приложения децентрализованных финансов (DeFi) и сети первого уровня. Это создаст более прочную связь между доходом протокола и стоимостью токена, предоставив инвесторам более привычные метрики оценки. Например, биржа Hyperliquid направила 99% своей выручки за прошлый год, превышающей $800 млн, на выкуп и сжигание токена HYPE. Uniswap после ребрендинга "UNIfication" активирует сбор комиссий протокола для финансирования сжигания UNI с декабря 2025 года. Aave DAO также реализует программу выкупа токенов, а её основатель заявил, что 100% доходов протокола и стейблкоина GHO направляется на поддержку токена AAVE. Хоуган связал этот тренд с более благоприятной регуляторной средой в США, где проекты ранее избегали функций распределения доходов из-за опасений, связанных с законодательством о ценных бумагах.

cointelegraph2 ч. назад

Оценки криптовалют могут удвоиться, поскольку протоколы связывают выручку с токенами: CIO Bitwise

cointelegraph2 ч. назад

Уолл-стрит утренний отчет: CPI мягко вступил в силу, фондовый рынок США показал глубокое V-образное восстановление; облачные технологии на базе ИИ, хранение данных и оптическая связь переживают коллективный взрыв

Ежедневный утренний отчет Wall Street Journal: индекс потребительских цен (CPI) вышел умеренным, фондовый рынок США продемонстрировал сильное восстановление («глубокую V-образную форму»), а сектора AI-облачных технологий, памяти и оптической связи пережили коллективный всплеск. Ключевые данные: ИПЦ США за июль вырос на 0,1% в месячном исчислении и на 3,4% в годовом исчислении, полностью соответствуя ожиданиям. Это, вместе со слабыми данными по занятости на прошлой неделе, снизило рыночные ожидания повышения ставки ФРС в сентябре. Рынки: Индекс S&P 500 вырос на 0,26%, Nasdaq Composite — на 0,54%. Основными движущими силами стали аппаратное обеспечение ИИ, память, оптическая связь и новые облачные вычисления. Золото сохранило силу, серебро выросло примерно на 14% в августе. Цены на нефть снизились после предыдущего роста. Главные темы: Дефицит вычислительных мощностей для ИИ стимулировал взрывной рост в секторах, связанных с инфраструктурой. Индекс полупроводников Philadelphia вырос на 2,49%. Акции поставщиков облачных вычислений (NEBIUS +34,14%, CoreWeave +19,28%), оптической связи (Lumentum +13,63%) и памяти (SK Hynix +9,01%) показали значительный рост. Динамика крупных компаний: NVIDIA выросла на 3,03%. SpaceX выросла на 9,65% после выпуска Grok 4.6. Акции Apple, Google, Meta, Microsoft и Tesla снизились. Контекст и предупреждения: Дефицит федерального бюджета США резко вырос. Агентство IEA предупредило о возможном крупном дефиците поставок нефти. Высокая стоимость страховки войны сдерживает судоходство в Ормузском проливе. Основные события для наблюдения: данные по PPI США за июль (13 августа), день инвестора SanDisk (13 августа), срок подачи отчетов 13F в SEC (14 августа), отчет о прибылях и убытках Applied Materials (14 августа).

marsbit2 ч. назад

Уолл-стрит утренний отчет: CPI мягко вступил в силу, фондовый рынок США показал глубокое V-образное восстановление; облачные технологии на базе ИИ, хранение данных и оптическая связь переживают коллективный взрыв

marsbit2 ч. назад

Торговля

Спот
活动图片