Oxford y NUS proponen la próxima dirección de los modelos del mundo: Ha llegado el modelo del mundo mental

marsbitPublicado a 2026-08-13Actualizado a 2026-08-13

Resumen

Investigadores de la Universidad de Oxford y la NUS proponen el 'Mental World Modeling' (MWM) como futuro de los modelos mundiales. Este marco formal incorpora variables mentales (creencias, deseos, intenciones) junto a las físicas en el estado del mundo, permitiendo predecir comportamientos humanos que dependen del estado mental y no solo de la realidad objetiva. El trabajo presenta MENTIS, un sistema modular de referencia que implementa MWM, descomponiendo la predicción de decisiones en etapas explícitas: análisis del estado, generación de observaciones del agente, simulación de transiciones acopladas físico-mentales y evaluación. Las pruebas muestran que MWM mejora significativamente la precisión predictiva, especialmente en escenarios de interacción social. El principal cuello de botella identificado es la simulación de la transición de estados. MWM es más valioso cuando la eficacia de una acción depende de variables mentales no inferibles solo desde el estado físico.

Imagina una escena: Una taza es guardada en un armario por A, y B no lo ve.

Pregunta: ¿A dónde irá B a buscar la taza?

Si el modelo del mundo solo conoce los hechos físicos, predecirá erróneamente la próxima decisión de B: «La taza está ahora en el armario, debería ir al armario a buscarla.» (Arriba)

Pero un modelo que también comprenda la mente humana puede predecir correctamente: «B no sabe que la taza fue movida, por lo tanto cree que aún está en la mesa, y probablemente volverá a buscarla junto a la mesa.» (Abajo)

El próximo estado del mundo también está determinado por variables mentales

Esto revela un problema clave: los modelos del mundo que solo rastrean objetos, ubicaciones y movimiento pueden obtener predicciones que son «físicamente razonables, pero conductualmente erróneas».

Recientemente, un equipo de investigación de la Universidad de Oxford y la Universidad Nacional de Singapur presentó en su último estudio «Mental World Modeling» un marco general, el Modelado del Mundo Mental (Mental World Modeling, MWM). Este trabajo incorpora estas variables mentales en sí mismas dentro del estado del mundo (world state), en lugar de tratarlas simplemente como explicaciones a posteriori (post-hoc explanations).

  • Título del artículo: Mental World Modeling
  • Enlace al artículo: https://arxiv.org/abs/2607.27201
  • Página del proyecto: https://mental-world.github.io/
  • Código abierto: https://github.com/mental-world/Mentis

Al momento de escribir esto, MWM ya ha llegado al primer lugar del Daily Papers de Hugging Face.

Hugging Face Paper: https://huggingface.co/papers/2607.27201

La otra mitad que falta en los modelos del mundo

La mayoría de los modelos del mundo existentes se centran principalmente en el aspecto físico del mundo:

  • ¿Qué objetos y agentes existen?
  • ¿Dónde están?
  • ¿Cómo evolucionará la escena visible?

En estos modelos, las personas a menudo son solo objetos que se mueven y realizan acciones, y sus estados internos no entran realmente en el modelo del mundo. Pero en el mundo real, las personas no son simplemente objetos en movimiento.

Para una inteligencia centrada en el ser humano (human-centered intelligence), esto está muy lejos de ser suficiente.

¿Por qué? Porque las decisiones de comportamiento humano no están determinadas únicamente por el entorno externo de objetos, estructura espacial y leyes físicas, sino que son producto de la interacción entre el entorno externo y las variables internas mentales-sociales.

Por ejemplo, un robot de servicio necesita juzgar si el usuario está confundido, impaciente o buscando ayuda de manera indirecta; un asistente médico debe considerar la cognición, percepción de riesgo, miedo y nivel de confianza del paciente; un agente colaborativo debe reconocer que ciertas acciones, aunque físicamente factibles, pueden no ser apropiadas debido a normas sociales, relaciones de roles o el contexto de interacción interpersonal.

Todos estos escenarios requieren que los sistemas inteligentes puedan rastrear continuamente los estados mentales y sociales de los agentes, incluyendo: qué saben, en qué creen, en qué se centran, qué desean, qué planean hacer, qué sienten, y qué comportamientos consideran socialmente permitidos. Incluso si dos escenarios son físicamente idénticos, siempre que las creencias, objetivos, emociones, relaciones interpersonales o responsabilidades sociales de las personas difieran, pueden generar comportamientos completamente diferentes.

En resumen: Un modelo del mundo, incluso si puede reconstruir con precisión una escena física, aún puede ser incapaz de predecir correctamente el comportamiento humano.

Las ciencias cognitivas ya han estudiado estas capacidades a través de teorías como los modelos mentales (mental models), la teoría de la mente (Theory of Mind, ToM), los modelos de agente BDI (Belief–Desire–Intention) y la cognición corporeizada (embodied cognition).

Sin embargo, la mayoría de la investigación actual en inteligencia artificial construye ya sea modelos del mundo físico que carecen de estados mentales, o simplifica el razonamiento psicológico en tareas aisladas de preguntas y respuestas de teoría de la mente (Theory-of-Mind question answering).

Ambas perspectivas son insuficientes para describir un mundo verdaderamente completo — porque el próximo estado del mundo no está determinado únicamente por factores físicos, sino que surge de la evolución conjunta (jointly physical and mental) del estado físico y el estado mental.

¿Cómo incorporar verdaderamente las variables mentales al espacio de estados del modelo del mundo?

Esta investigación intenta proponer un marco formal de Modelado del Mundo Mental, para construir modelos del mundo capaces de representar simultáneamente la dinámica física y la mental.

El objetivo del Modelado del Mundo Mental no es simular la conciencia y experiencia subjetiva privada de una persona, sino construir un simulador del mundo externo, aproximado y relevante para la tarea (task-relevant world simulator). El estado global de este simulador incluye simultáneamente variables físicas (physical variables) y variables mentales (mental variables).

Dos entidades, tres módulos de operación, un estado físico-mental acoplado. El modelo del mundo mental actúa como un simulador global, generando primero la información que el agente objetivo puede ver e inferir, y luego permitiendo que el agente actúe basándose en esta percepción.

En primer lugar, el Modelado del Mundo Mental mantiene un estado del mundo físico-mental acoplado (coupled physical–mental world state), es decir, representa simultáneamente el entorno físico y los estados mentales latentes de los agentes.

En segundo lugar, un agente objetivo (target agent) solo puede observar una representación parcial y en primera persona (partial, first-person rendering) de este estado global después de una transformación. Para cada agente objetivo, MWM genera una perspectiva de observación local dirigida a ese agente — es decir, lo que esa persona realmente puede ver, oír, saber e inferir;

Posteriormente, el agente objetivo actúa basándose en esta observación, y el modelo del mundo simula cómo esa acción cambiará simultáneamente:

  1. La escena objetiva en el mundo físico;
  2. La configuración de estados en el mundo mental-social (mental-social configuration).

¿Cómo verificar que MWM es efectivo?

Para hacer que este marco sea verificable, el equipo implementó un sistema de referencia modular MENTIS, un sistema de referencia completamente observable y que no requiere entrenamiento, que obliga a los sistemas basados en modelos de lenguaje grandes (LLM) a razonar de la manera del modelo del mundo mental.

Flujo de MENTIS.

El sistema primero convierte la escena de entrada en un estado actual estructurado

Genera la observación del pseudogente objetivo

, analiza cada opción candidata como una rama de comportamiento, simula en paralelo los cambios posteriores en el estado físico y mental, y finalmente evalúa los diferentes resultados futuros y selecciona el comportamiento final.

Dado un escenario contextualizado, un agente objetivo y un conjunto de comportamientos candidatos, MENTIS descompone el proceso de predicción de decisiones en una serie de etapas explícitas: análisis de estado → generación de observación objetivo → descomposición de comportamiento → simulación de transición de estado físico-mental acoplado → evaluación a nivel de rama → decisión final.

  • Primero, analiza la escena en un estado físico-mental con estructura tipada;
  • Luego, genera a partir de ese estado la observación local que el agente objetivo puede obtener;
  • Después, descompone cada comportamiento candidato en sus efectos a nivel físico y a nivel mental correspondientes;
  • A continuación, para cada posible rama de comportamiento simula su siguiente estado físico-mental acoplado;
  • Finalmente, puntúa cada rama en tres dimensiones: razonabilidad física, consistencia mental y normatividad social, y selecciona el comportamiento final mediante reglas deterministas.

En otras palabras, MENTIS ya no permite que el modelo salte directamente de la escena a la predicción del comportamiento, sino que le exige que modele explícitamente: en qué estado se encuentra el mundo, cómo percibe el mundo el agente objetivo, cómo diferentes acciones cambiarían los estados físico y mental, y qué comportamiento es más razonable física y socialmente.

MENTIS no requiere entrenamiento, por lo que sus resultados reflejan la capacidad de razonamiento inherente a la estructura del modelo mismo, y no dependen de parámetros obtenidos por ajuste. Cada etapa del sistema produce resultados intermedios que pueden ser verificados automáticamente, por lo que los estados, observaciones y futuros simulados pueden registrarse, compararse con anotaciones humanas o directamente reemplazarse con valores anotados reales para su análisis.

¿Es realmente efectivo MWM? ¿Cuáles son sus cuellos de botella?

Los investigadores diseñaron una serie de conjuntos experimentales específicamente para probar los posibles puntos de falla del marco, y los resultados muestran un patrón consistente.

En primer lugar, el modelado explícito del mundo mental es necesario para predecir las decisiones humanas.

Escalera de necesidad (comportamiento final F1, 448 registros). (a) Puntuación F1 de ocho modelos del mundo en diferentes etapas de la escalera (las líneas finas muestran los resultados de modelos individuales, la línea gruesa el resultado promedio) (b) Resultados del experimento de ablación S6 en los ocho modelos (los puntos blancos indican los valores correspondientes de cada modelo).

En los 8 modelos del mundo basados en LLM probados, la respuesta directa promedio tuvo un F1 de 63.3; las configuraciones completas de MWM lograron el mejor rendimiento con 87.9; eliminar el canal mental provocó una caída en el rendimiento de todos los modelos de aproximadamente 12.1 puntos, eliminar el canal físico causó una caída de 16.5 puntos, y predecir por separado las transiciones de los dos estados también redujo el rendimiento en 6.4 puntos.

Rendimiento de F1 en cuatro configuraciones experimentales en diferentes categorías de escenarios

Y la mayor mejora en el rendimiento se dio precisamente en los escenarios de interacción interpersonal, porque las decisiones en estos escenarios dependen principalmente de variables mentales ocultas. Para gpt-5.6-sol, el MWM completo aumentó el F1 de la acción final de 66.5 (respuesta directa) a 92.9, un incremento de 26.4 puntos. Este resultado pertenece solo a las pruebas controladas del artículo, pero es consistente con la motivación de la investigación: cuando las creencias, roles y relaciones dominan el siguiente paso, las variables físicas por sí solas no pueden explicar la acción.

Entonces, ¿cuál es el verdadero cuello de botella?

Además de demostrar su necesidad, el artículo realizó un diagnóstico más orientativo: reemplazar un paso intermedio con información correcta (intervención Oracle), y luego ver cuánto podía mejorar la predicción final, atribuyendo así aún más las diferencias entre el modelo y los humanos.

Experimento de intervención Oracle (gpt-5.6-sol). Puntuación F1 del comportamiento final después de sustituir la información predicha por el modelo con anotaciones reales en una o más etapas; las etiquetas de las barras indican la mejora de rendimiento obtenida en comparación con la versión de predicción completa S6.

Los resultados experimentales muestran que para gpt-5.6-sol, el MWM completo fue de 90.7, y el uso de transiciones de estado anotadas realmente pudo aumentar a 94.2, proporcionando una mejora de rendimiento de +3.5, la mayor ganancia en una intervención individual. Solo con la intervención en la transición de estado, el modelo pudo compensar el 45% de la brecha de rendimiento humano (7.8 puntos).

Los resultados indican que el mayor cuello de botella restante actualmente es la simulación de la transición de estado, es decir, la capacidad insuficiente del modelo para predecir cómo cambia el mundo físico-mental acoplado. Esto proporciona una dirección clara para futuras mejoras en los sistemas MWM.

¿Cuándo es más efectivo el Modelado del Mundo Mental?

El valor aplicado del MWM no debe medirse por «cuántos dominios sociales puede enumerar». Después de todo, casi todos los sistemas orientados a humanos, en un sentido amplio, tienen cierto carácter «social».

Un criterio de juicio más preciso y significativo es:

El MWM tiene un valor real cuando la efectividad de un comportamiento depende de variables que no se pueden inferir únicamente de la escena física, pero que determinan cómo los humanos perciben, eligen, aceptan, resisten o aprenden.

Desde la perspectiva de la teoría de la decisión, el valor de la información del estado mental puede definirse como:

La brecha de utilidad esperada (expected utility gap) entre la intervención óptima seleccionada cuando se puede acceder al estado físico-mental acoplado, y la intervención óptima seleccionada basándose únicamente en el estado físico.

Esta brecha será muy significativa cuando las creencias, objetivos, atención, confianza, obligaciones, estados emocionales o normas sociales cambien «cuál comportamiento es beneficioso»; mientras que será pequeña cuando el siguiente comportamiento esté casi completamente determinado por la factibilidad física.

Por ejemplo, un controlador de agarre mecánico no necesita MWM para realizar la acción de «alcanzar y agarrar una taza»; pero un robot de servicio doméstico, al decidir «si entregar esta taza a su dueño», necesita comprender los estados mentales y sociales subyacentes — si este comportamiento está ofreciendo ayuda, molestando, siendo descortés, creando riesgo o transmitiendo información errónea.

Resumen

Este trabajo propone un marco formal de Modelado del Mundo Mental para construir modelos del mundo capaces de representar simultáneamente la dinámica física y la mental. Sus contribuciones principales se pueden resumir en tres puntos:

Proponer el Modelado del Mundo Mental: Un marco matemático formal que fusiona la dinámica física y la mental en una perspectiva unificada de modelado del mundo, permitiendo que los sistemas de IA no solo razonen sobre cómo cambia el entorno, sino que también comprendan cómo los agentes perciben, interpretan y responden a nivel mental a estos cambios.

Proponer MENTIS: Una implementación de referencia que no requiere entrenamiento, que materializa y hace operable el marco MWM a través de módulos como análisis de estado, generación de observaciones, descomposición de comportamientos, transición de estado físico-mental acoplado y evaluación de valor a nivel de rama.

Realizar una investigación empírica sistemática, cuyos resultados condensan dos conclusiones centrales:

El modelado explícito del mundo mental es necesario para predecir las decisiones humanas, especialmente en escenarios de interacción social y relaciones interpersonales;

El cuello de botella clave actual de los sistemas MWM reside en la capacidad insuficiente de simulación de la transición de estado, lo que también señala la dirección para futuras mejoras en la investigación.

Este artículo proviene del WeChat oficial account «机器之心» (Corazón de la Máquina)

Preguntas relacionadas

Q¿Cuál es el principal problema que resuelve el modelo Mental World Modeling (MWM) propuesto por Oxford y NUS?

AEl modelo MWM resuelve el problema de que los modelos del mundo tradicionales, que solo rastrean objetos, ubicaciones y movimientos físicos, a menudo hacen predicciones 'físicamente plausibles pero conductualmente incorrectas'. Al incorporar variables mentales (como creencias, objetivos y emociones) junto con las variables físicas en el estado del mundo, puede predecir con precisión el comportamiento humano, como en el ejemplo de dónde buscaría una persona un vaso movido sin su conocimiento.

Q¿Qué es MENTIS y cómo funciona dentro del marco MWM?

AMENTIS es una implementación de referencia modular y sin entrenamiento del marco MWM. Funciona descomponiendo el proceso de predicción de decisiones en etapas explícitas: análisis del estado físico-mental, generación de observaciones para el agente objetivo, descomposición de acciones candidatas, simulación de la transición acoplada del estado físico-mental, evaluación de ramas y selección final de la acción. Esto obliga a un sistema basado en LLM a razonar explícitamente sobre el estado mundial y su evolución, en lugar de saltar directamente de la escena a una predicción.

QSegún los experimentos, ¿cuál es la principal limitación o cuello de botella actual de los sistemas MWM?

ALa principal limitación identificada es la capacidad de simulación de la transición de estado (state transfer simulation). Los experimentos de intervención 'Oracle' mostraron que proporcionar información de transición de estado correcta produjo la mayor mejora de rendimiento (+3.5 puntos F1), cubriendo el 45% de la brecha restante con el rendimiento humano. Esto indica que predecir con precisión cómo cambian conjuntamente los estados físicos y mentales es el desafío más importante para mejorar estos sistemas.

Q¿En qué tipo de escenarios o aplicaciones el enfoque MWM demuestra ser más valioso y necesario?

AEl enfoque MWM es más valioso en escenarios donde la efectividad de una acción depende de variables mentales que no se pueden inferir solo de la escena física, pero que determinan cómo los humanos perciben, eligen o reaccionan. Esto es especialmente crucial en interacciones sociales y contextos centrados en el ser humano, como un robot de servicio juzgando la confusión de un usuario, un asistente médico considerando el miedo de un paciente, o un agente colaborativo entendiendo normas sociales. En tareas puramente físicas (como agarrar un objeto), la brecha de utilidad esperada al añadir estados mentales es pequeña.

Q¿Qué diferencia al estado del mundo en MWM de los modelos del mundo tradicionales?

AA diferencia de los modelos del mundo tradicionales que mantienen un estado compuesto únicamente por variables físicas (objetos, ubicaciones, movimientos), el estado del mundo en MWM es un 'estado del mundo físico-mental acoplado' (coupled physical–mental world state). Este estado representa simultáneamente tanto la configuración física objetiva del entorno como los estados mentales latentes de los agentes (sus creencias, conocimientos, deseos, intenciones, emociones y relaciones sociales), reconociendo que el próximo estado del mundo está determinado por la evolución conjunta de ambos aspectos.

Lecturas Relacionadas

¿Por qué NeoCloud ha sido la acción con mayor subida en esta recuperación de las tecnológicas de EE.UU.?

En el último repunte de las acciones tecnológicas en Wall Street, NeoCloud (que incluye a empresas como CoreWeave y Nebius) ha registrado los mayores incrementos. Esto se debe a que el mercado está valorando una "palanca" clave de la infraestructura de IA: la capacidad de cómputo comprometida por contratos y que puede entregarse rápidamente. La escasez actual ya no es solo de GPU, sino de la capacidad integral para implementar clústeres a gran escala, incluyendo energía, centros de datos y conectividad. NeoCloud cubre este vacío, ofreciendo "fábricas de cálculo ya energizadas". Su atractivo radica en la escasez de estos recursos y en la posibilidad de bloquearlos mediante contratos a largo plazo, lo que los convierte en activos con flujos de caja predecibles. Los últimos informes financieros han cambiado la percepción del modelo de negocio, mostrando un ciclo virtuoso: contratos de capacidad con clientes de IA → prefinanciación y compromisos de pago → mayor facilidad para obtener financiación de deuda → expansión de la capacidad → crecimiento de ingresos y EBITDA. Esto ha transformado la narrativa, de un arrendador de GPU con alto Capex a un operador de infraestructura de IA impulsado por pedidos. El mercado otorga a NeoCloud una mayor elasticidad al alza que a los gigantes de la nube o a los fabricantes de semiconductores, debido a su menor base de ingresos, exposición pura a la IA y el impacto marginal significativo de cada nuevo contrato grande en sus valoraciones. Su ventaja competitiva reside en una triple palanca: operativa (altos costes fijos), financiera (capacidad de apalancamiento con deuda respaldada por contratos) y de capital (revalorización acelerada del patrimonio). La revalorización actual se centra en la visibilidad de los ingresos futuros, garantizada por contratos de "pago mínimo" a largo plazo, y en la revalorización de un recurso cada vez más escaso: la capacidad energética. En última instancia, el desempeño continuo de NeoCloud dependerá de su capacidad para convertir estos grandes pedidos en clústeres operativos, ingresos reconocidos y flujos de caja que cubran el coste del capital.

marsbitHace 1 hora(s)

¿Por qué NeoCloud ha sido la acción con mayor subida en esta recuperación de las tecnológicas de EE.UU.?

marsbitHace 1 hora(s)

Wall Street Morning Post: El IPC moderado se asienta, las acciones estadounidenses registran una recuperación en V, con explosión colectiva en nube de IA, almacenamiento y comunicación óptica

**Resumen del Boletín de Wall Street: CPI moderado, rebote en V de las acciones, auge de la nube de IA, almacenamiento y comunicaciones ópticas** Los principales índices de Wall Street cerraron al alza. El IPC de julio de EE.UU. se alineó con las expectativas, reduciendo las probabilidades de una subida de tasas en septiembre y tranquilizando al mercado sobre la inflación. El enfoque del mercado se desplazó claramente hacia la infraestructura de IA. Los sectores de **nube de IA, semiconductores, almacenamiento y comunicaciones ópticas** experimentaron fuertes subidas. Destacaron las ganancias de NEBIUS (+34.14%), CoreWeave (+19.28%) y Lumentum (+13.63%), respaldadas por sólidos resultados financieros y una gran demanda de capacidad de cálculo. La publicación de modelos como **DeepSeek V4 Pro** y **Grok 4.6 de SpaceX AI**, con precios competitivos, intensifica la competencia en el campo de la IA. Los metales preciosos mantuvieron su fortaleza, y el petróleo cedió terreno a la espera de avances en la reapertura del Estrecho de Ormuz. Las preocupaciones fiscales de EE.UU. persisten, con un déficit presupuestario récord en julio. **Atención próximos días:** Informe del PPI de EE.UU. y Día del Inversor de Western Digital (jueves); presentaciones de posiciones institucionales (13F) y resultados de Applied Materials (viernes).

marsbitHace 2 hora(s)

Wall Street Morning Post: El IPC moderado se asienta, las acciones estadounidenses registran una recuperación en V, con explosión colectiva en nube de IA, almacenamiento y comunicación óptica

marsbitHace 2 hora(s)

Trading

Spot
活动图片