GPT-5 también tiene lapsus mentales, Google lo probó 4.5 millones de veces: las llaves se perdieron

marsbitPublicado a 2026-08-14Actualizado a 2026-08-14

Resumen

Los grandes modelos de lenguaje como GPT-5 y Gemini 3 tienen un problema similar al fenómeno de "punta de la lengua" en humanos: a menudo no pueden recuperar hechos que sí han almacenado en sus parámetros. Un estudio de Google, "Empty Shelves or Lost Keys?" (ICML 2026), analizó 4.5 millones de respuestas en el benchmark WikiProfile (2,150 hechos de Wikipedia) y descubrió que, si bien estos modelos codifican del 95% al 98% de los hechos, fallan al recuperar directamente entre el 26% y el 34%. De estos fallos, la mayoría son "errores de recuperación", no de codificación. Los principales puntos débiles son el conocimiento de nicho y las preguntas formuladas de forma inversa (p.ej., "¿quién es el hijo de X?" vs. "¿quién es la madre de Y?"). El conocimiento poco frecuente se almacena casi tan bien como el popular, pero es mucho más difícil de recuperar. La función "thinking" (pensamiento) ayuda, recuperando entre el 40% y el 65% de los hechos almacenados pero no accesibles, actuando como una "activación por difusión" que construye un puente semántico hacia la respuesta. El estudio muestra que escalar el tamaño del modelo mejora la codificación, pero no resuelve el cuello de botella de la recuperación. En modelos avanzados, más del 70% de los errores se deben a fallos de recuperación. El futuro progreso requiere mejoras en el entrenamiento posterior y la inferencia, incluyendo una mejor metacognición: el modelo debe primero darse cuenta de que no recuerda algo para activar estrat...

Ese nombre lo tienes en la punta de la lengua.

Ves una cara conocida, pero no logras recordar su nombre. La psicología le puso un nombre a este fenómeno: el "fenómeno de la punta de la lengua" (tip-of-the-tongue).

Ahora, Google descubrió en un estudio que GPT-5 y Gemini 3 tienen el mismo problema.

Estos dos modelos almacenaron en sus parámetros entre el 95% y el 98% de los hechos utilizados en las pruebas. Sin embargo, si les preguntas directamente, no pudieron responder entre el 26% y el 34% de esos hechos.

Si les pides que piensen (thinking) un poco más, todavía queda un 11%–12% que no logran recordar.

Que un modelo grande no responda, en muchos casos, no es porque no tenga la información en su "cerebro". Es que la aprendió, pero no puede extraerla.

Este estudio se titula "¿Estanterías vacías o llaves perdidas?" (Empty Shelves or Lost Keys?), y está incluido en ICML 2026.

El 12 de agosto, Google Research publicó un blog resumiendo los resultados, y al mismo tiempo liberaron una nueva referencia (benchmark) llamada WikiProfile y un conjunto completo de datos.

Las estanterías no están vacías, se perdieron las llaves

Que un modelo responda mal a una pregunta puede deberse a dos problemas diferentes.

El primero es que simplemente no lo aprendió. Eso requeriría añadir más datos y parámetros durante el preentrenamiento. El segundo es que sí lo aprendió, pero no puede recuperarlo si la pregunta se formula de otra manera, lo cual es un asunto del postentrenamiento y la inferencia.

Ambos problemas solían agruparse como una cuestión de precisión.

El marco de "perfil de conocimiento" ("knowledge profile") propuesto por Google ya no pregunta "¿se respondió correctamente esta pregunta?", sino que juzga "¿en qué estado se encuentra este hecho en la memoria del modelo?". Clasifica cada hecho en cinco estados posibles.

El "perfil de conocimiento" divide un hecho en cinco estados: fallo de codificación, fallo de recuerdo, recuerdo directo, recuerdo con ayuda del 'thinking', y respuesta correcta por inferencia aunque no esté almacenado.

La misma respuesta errónea, en estados diferentes, requiere métodos de corrección completamente distintos.

¿Cómo juzgar si un hecho se almacenó o no?

El método consiste en truncar el texto original de Wikipedia justo antes de que aparezca la respuesta, y pedirle al modelo que continúe escribiendo; o hacer una pregunta directa después del mismo contexto.

En ambas preguntas no se permite el 'thinking', con el fin de separar lo "memorizado" de lo "inferido".

La izquierda mide si se almacenó o no, truncando el texto de Wikipedia para que el modelo lo complete; la derecha mide si puede responder o no, reformulando la pregunta, cambiando el enfoque positivo/negativo, y preguntando repetidamente.

La referencia se llama WikiProfile y contiene un total de 2150 hechos, todos extraídos de la Wikipedia en inglés.

Cada hecho viene con 10 preguntas: 2 para medir si se almacenó, 4 para que responda por sí mismo, y 4 para que elija entre opciones. En total, 21,500 preguntas.

La generación de las preguntas se delegó por completo a modelos: Gemini-2.5-Pro las generó, se verificó cada una con Google Search, y se descartaron aquellas preguntas (junto con el hecho completo) cuyas respuestas no fueran únicas o fueran ambiguas. Finalmente, se hizo una revisión manual y se eliminó menos del 2% adicional.

Los modelos evaluados fueron 13, cubriendo las familias Gemini 3, GPT-5, GPT-4.1 y Gemma 3. Cada modelo se ejecutó una vez con 'thinking' activado y otra desactivado, se tomaron ocho muestras por pregunta, acumulando aproximadamente 4.5 millones de respuestas.

Probar un modelo de vanguardia por completo cuesta alrededor de 500 dólares.

Los resultados son los números del principio.

En los errores fácticos de los modelos de vanguardia, "no poder extraer" ya supera a "no haber aprendido", convirtiéndose en el problema principal.

Lo que no se puede extraer, se atasca en los mismos dos lugares

El primero es el conocimiento poco común.

La explicación principal anterior era que la capacidad del modelo era insuficiente, y algunos hechos poco comunes simplemente no se habían aprendido.

Con estos datos, los conocimientos poco comunes SÍ se almacenaron. Gemini-3-Pro almacenó el 94.5% de los hechos poco comunes, mientras que para los hechos populares fue el 99.5%, solo 5 puntos de diferencia.

Pero al responder, la tasa de acierto para hechos poco comunes cayó al 63.3%, mientras que para los populares fue del 84.7%, una diferencia de 21 puntos.

Al almacenar, casi no hay diferencia. Al extraer, la diferencia se cuadruplica.

Comparación entre hechos poco comunes (último 20%) y populares (primer 20%). La diferencia en la tasa de almacenamiento es pequeña, la diferencia en la tasa de recuerdo directo se amplía notablemente.

La brecha en GPT-5 es aún mayor.

Almacenó el 90.7% de los hechos poco comunes y el 98.4% de los populares. Pero al responder, solo recordó directamente el 52.9% de los hechos poco comunes, mientras que para los populares fue el 77.8%.

Casi la mitad de los hechos poco comunes claramente están dentro del modelo, pero no se pueden recuperar.

La diferencia al almacenar es pequeña, la diferencia al extraer es grande. La verdad sobre los problemas de la "larga cola" (long tail) no es que el modelo no haya visto esos hechos poco comunes, sino que ese conocimiento es más difícil de "despertar".

El segundo escenario es la pregunta inversa. Si le preguntas a la IA quién es la madre de Tom Cruise, responde rápida y correctamente. Si preguntas al revés, quién es el hijo de esta señora, se atasca.

El artículo de 2023 le puso el nombre de "maldición de la inversión" (reversal curse). El modelo aprendió que "A es B", pero no generaliza automáticamente que "B es A". La explicación de entonces era: la asociación bidireccional simplemente no se aprendió.

Google convirtió el mismo conjunto de preguntas en opción múltiple de cuatro respuestas, y el resultado inmediatamente se invirtió.

La tasa de recuerdo de GPT-5 en preguntas directas fue del 82.9%, y en inversas bajó al 74%. Pero al cambiarlas a preguntas de reconocimiento con opciones, las inversas no solo no fueron más difíciles que las directas, sino que 9 de los 13 modelos respondieron incluso mejor en las inversas, y los 4 restantes se mantuvieron igual.

Resuelve las preguntas de opción múltiple, pero no puede responder cuando se convierten en preguntas abiertas.

El mismo conjunto de preguntas directas/inversas. En el reconocimiento con opción múltiple, las inversas no son más difíciles que las directas; en la generación abierta, las inversas son claramente más difíciles.

Esto indica que claramente existe esa asociación. Lo que realmente se atasca es cómo extraerla.

La explicación de los autores es que cuando un hecho se almacena, el contexto, la redacción y el orden presentes en ese momento también quedan registrados en su interior.

Si tu forma de preguntar se desvía de cómo fue durante el entrenamiento, la llave ya no encaja en la cerradura.

La otra identidad del 'thinking': ayudarle a recordar

Las preguntas en WikiProfile son de "pregunta-respuesta", sin pasos de razonamiento intermedios.

"¿En qué club fue el primer concierto de Oasis?" Este tipo de pregunta, o la recuerdas o no.

En teoría, pedirle al modelo que piense un poco más no debería ayudar mucho.

Pero el 'thinking' realmente rescató información. Recuperó entre el 40% y el 65% de los hechos que estaban almacenados pero que no podían responderse.

La pista clave está en su preferencia: para los hechos que ni siquiera se almacenaron, el 'thinking' solo pudo recuperar entre el 5% y el 15%.

Proporción de hechos recuperados tras activar el 'thinking'. Para los ya almacenados en parámetros, se recupera 40%–65%; para los no almacenados, solo 5%–15%.

No está deduciendo a partir de otro conocimiento, está buscando la llave en el mismo lugar.

Los autores también descartaron una explicación más sencilla.

Alguien podría pensar que el 'thinking' simplemente hace que el modelo responda de manera más elaborada, aumentando la oportunidad de acertar una de las ocho veces. Si fuera así, las respuestas deberían ser más dispersas.

En realidad, sucedió lo contrario: con 'thinking' activado, la cantidad de respuestas correctas en las ocho muestras para la misma pregunta se concentró más.

Los dos lugares donde más beneficio aportó coinciden exactamente con los dos más bloqueados anteriormente.

La brecha entre hechos populares y poco comunes de Gemini-3-Pro se redujo de 21.4 puntos a 12.5 puntos; la brecha entre preguntas directas e inversas de GPT-5 se redujo de 9 puntos a 2 puntos. Donde más se atascaba, es donde más fuerza aplicó.

Otro artículo complementario de Google, "Pensar para recordar" (Thinking to Recall), ofrece una explicación del mecanismo:

Uno, es un búfer computacional: esos tokens de pensamiento que genera, incluso si su contenido en sí no tiene mucho significado, le dan al modelo potencia de cálculo implícita adicional.

Dos, es el "arranque fáctico" (fact priming): el modelo primero menciona un conjunto de hechos relacionados, lo que equivale a construir un puente semántico hacia la respuesta correcta.

En la cognición humana, esto se llama "activación propagada" (spreading activation).

Si no recuerdas el nombre de alguien, primero recuerdas en qué empresa trabaja, qué peinado tiene, en qué circunstancias lo viste la última vez... y el nombre a menudo surge por sí solo.

La forma de superar el "fenómeno de la punta de la lengua" resulta ser la misma para humanos y modelos.

Pero este método también tiene un costo.

El mismo artículo advierte: si los hechos intermedios en la cadena de pensamiento están inventados, la probabilidad de alucinación en la respuesta final es incluso mayor.

Si el puente está mal construido, cuanto más lejos vayas, más te equivocarás.

Escalar equivale a reabastecer, no a proporcionar llaves

Tomemos la familia de código abierto Gemma 3 como referencia.

A medida que los parámetros aumentan de 1B a 27B, la tasa de fallos de codificación cae del 85% al 23%.

La escala ciertamente reabastece, las estanterías se llenan visiblemente. Pero los fallos de recuerdo no disminuyen simultáneamente. Su proporción dentro de los errores restantes aumenta constantemente, y en el modelo de 27B se convierte en el componente principal del error.

En los modelos de vanguardia es aún más extremo: los fallos de recuerdo representan más del 70% de todos los errores de GPT-5.2, y cuanto más fuerte es el modelo, mayor es esta proporción.

Distribución de los cinco estados en los 13 modelos. A mayor número de parámetros, los fallos de codificación se reducen constantemente, mientras que los fallos de recuerdo prácticamente no se mueven.

La escala mejora cuánto se almacena, no cuánto se puede extraer.

Esto no es una sentencia de muerte para el escalado (scaling), sino que le traza un límite.

Dado que la proporción de hechos almacenados ya está rozando el techo del 95%–98%, continuar añadiendo parámetros y datos aportará ganancias de precisión cada vez menores y más visibles.

Las siguientes ganancias es más probable que provengan de métodos durante el postentrenamiento y la inferencia, es decir, de cómo usar mejor el conocimiento ya almacenado.

El aumento con recuperación (RAG) puede, por supuesto, cubrir el vacío.

Pero los autores también advierten: el conocimiento en los parámetros todavía está relacionado con la fluidez, la velocidad de respuesta y la integración entre contextos, aspectos difíciles de reemplazar completamente con una recuperación externa.

Primero tiene que saber que no lo recuerda

Entonces, ¿cuándo se le debería pedir al modelo que piense un poco más?

El artículo define este problema como metacognición, es decir, el juicio del modelo sobre su propio estado: primero debe darse cuenta de que "no puedo responder directamente" para saber que esa pregunta merece activar el 'thinking' y pensar un poco más.

En los últimos dos años, la respuesta por defecto para hacer que los modelos sean más confiables era alimentarlos con más datos y acumular más parámetros.

Este estudio lo deja claro: a nivel fáctico, los modelos de vanguardia ya tienen sus estanterías bastante llenas. Lo siguiente que se pondrá a prueba es si pueden extraer esa información por sí mismos.

Y el siguiente paso es aún más complicado: primero tienen que saber que no lo recuerdan.

Referencias:

https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/

https://aihot.virxact.com/items/cmsqe6mat01bsroli3hw71nz7

Este artículo proviene del WeChat Official Account "新智元", autor: ASI启示录

Preguntas relacionadas

Q¿Qué es el 'fenómeno de la punta de la lengua' en el contexto de los modelos de IA como GPT-5 y Gemini 3?

AEl 'fenómeno de la punta de la lengua' (tip-of-the-tongue) se refiere a la situación en la que un modelo de IA, como GPT-5 o Gemini 3, tiene un hecho almacenado en sus parámetros pero no puede recuperarlo al responder una pregunta directa, similar a cuando una persona no recuerda un nombre conocido.

QSegún el estudio de Google, ¿cuál es la principal causa de los errores en los modelos de IA de vanguardia como GPT-5?

ALa principal causa de los errores en modelos de vanguardia como GPT-5 es el 'fallo de recuperación' (lost keys), es decir, la incapacidad de acceder a hechos que ya están almacenados en la memoria del modelo, en lugar de no haberlos aprendido.

Q¿Qué dos escenarios específicos identificó el estudio donde los modelos tienen más dificultad para recuperar información?

AEl estudio identificó dos escenarios clave: 1) Conocimiento de nicho o menos popular, donde los hechos están almacenados pero son mucho más difíciles de recuperar, y 2) Preguntas inversas, donde el modelo sabe 'A es B' pero le cuesta responder 'B es A' en formato de respuesta abierta.

Q¿Cómo ayuda la función 'thinking' (pensar) a los modelos a recordar hechos almacenados?

ALa función 'thinking' ayuda principalmente mediante dos mecanismos: proporcionando un búfer de cómputo adicional (capacidad de procesamiento implícita) y activando la difusión semántica, donde el modelo genera hechos relacionados que actúan como un puente para recuperar la respuesta correcta.

QSegún la investigación, ¿mejora el escalado de parámetros (scaling) la capacidad de los modelos para recuperar información?

ANo fundamentalmente. El escalado de parámetros mejora principalmente la tasa de codificación (almacenar hechos), pero no reduce significativamente el 'fallo de recuperación'. En modelos avanzados, la recuperación se convierte en el cuello de botella principal, por lo que las ganancias futuras deben venir de mejoras en el entrenamiento posterior y la inferencia.

Lecturas Relacionadas

Nueva función de ChatGPT: La IA ha comenzado a monitorear a los usuarios

OpenAI ha lanzado una nueva función llamada "Computer History" para la aplicación de escritorio de ChatGPT en macOS. Esta herramienta, disponible desde el 13 de agosto para suscriptores Pro, Business y Enterprise, analiza la actividad del usuario en distintas aplicaciones y sitios web para personalizar y hacer más precisas las respuestas del modelo. La función, que opera en segundo plano y requiere activación manual en la configuración, crea una línea temporal de actividad. Esto permite a ChatGPT recordar tareas y patrones de trabajo recurrentes, reduciendo la necesidad de proporcionar contexto manualmente en conversaciones futuras. Los usuarios tienen control total sobre su privacidad, pudiendo revisar, eliminar segmentos o la historia completa, y la función no se activa sin su consentimiento expreso. Sin embargo, el lanzamiento se ha retrasado en la Unión Europea, Reino Unido y Suiza. OpenAI está adaptando la herramienta para cumplir con las estrictas normativas locales de protección de datos antes de su disponibilidad en estas regiones. Este movimiento forma parte de una tendencia más amplia hacia modelos de IA con "memoria" persistente, compitiendo con soluciones similares de Anthropic y Google. Surgen preguntas sobre los riesgos técnicos de versiones anteriores y si el consentimiento voluntario será suficiente para mantener la confianza del usuario a medida que se recopilan más datos de actividad.

cryptonews.ruHace 1 hora(s)

Nueva función de ChatGPT: La IA ha comenzado a monitorear a los usuarios

cryptonews.ruHace 1 hora(s)

¡La plataforma analítica Santiment informa de que se está extendiendo rápidamente entre los inversores la opinión de que 'las criptomonedas están muertas'! ¿Es una señal de que el mercado ha tocado fondo? Aquí...

La plataforma de análisis Santiment informa de un aumento significativo en el uso de frases como "las criptomonedas están muertas" en redes sociales como Reddit y Telegram, lo que refleja un creciente pesimismo entre los inversores minoristas debido a la presión persistente sobre los precios y los bajos volúmenes de negociación. Según Santiment, este tipo de narrativa extrema suele surgir cuando la paciencia de los inversores se agota tras periodos prolongados de precios estancados y ausencia de la esperada recuperación. Históricamente, estos momentos de máximo pesimismo han coincidido a menudo con puntos de inflexión importantes del mercado, precediendo a fuertes recuperaciones que contradicen las expectativas generalizadas. La empresa destaca que un enfoque contrario, que tome posiciones opuestas a la tendencia predominante, podría considerar estos periodos de creencia generalizada en el "fin" de las criptomonedas como una señal para vigilar atentamente. Los analistas reconocen que el temor actual puede ejercer presión a corto plazo, pero señalan que niveles similares de sentimiento negativo marcaron mínimos significativos en ciclos anteriores. En conclusión, Santiment sugiere que cuando el pesimismo entre los inversores alcanza su punto máximo, se podrían presentar oportunidades potenciales para aquellos con una perspectiva paciente y a largo plazo, convirtiendo el sentimiento en redes sociales en un indicador relevante para evaluar la dirección del mercado.

cryptonews.ruHace 1 hora(s)

¡La plataforma analítica Santiment informa de que se está extendiendo rápidamente entre los inversores la opinión de que 'las criptomonedas están muertas'! ¿Es una señal de que el mercado ha tocado fondo? Aquí...

cryptonews.ruHace 1 hora(s)

Trading

Spot
活动图片