GPT-5 también tiene lapsus mentales, Google lo probó 4.5 millones de veces: las llaves se perdieron
Los grandes modelos de lenguaje como GPT-5 y Gemini 3 tienen un problema similar al fenómeno de "punta de la lengua" en humanos: a menudo no pueden recuperar hechos que sí han almacenado en sus parámetros. Un estudio de Google, "Empty Shelves or Lost Keys?" (ICML 2026), analizó 4.5 millones de respuestas en el benchmark WikiProfile (2,150 hechos de Wikipedia) y descubrió que, si bien estos modelos codifican del 95% al 98% de los hechos, fallan al recuperar directamente entre el 26% y el 34%. De estos fallos, la mayoría son "errores de recuperación", no de codificación.
Los principales puntos débiles son el conocimiento de nicho y las preguntas formuladas de forma inversa (p.ej., "¿quién es el hijo de X?" vs. "¿quién es la madre de Y?"). El conocimiento poco frecuente se almacena casi tan bien como el popular, pero es mucho más difícil de recuperar. La función "thinking" (pensamiento) ayuda, recuperando entre el 40% y el 65% de los hechos almacenados pero no accesibles, actuando como una "activación por difusión" que construye un puente semántico hacia la respuesta.
El estudio muestra que escalar el tamaño del modelo mejora la codificación, pero no resuelve el cuello de botella de la recuperación. En modelos avanzados, más del 70% de los errores se deben a fallos de recuperación. El futuro progreso requiere mejoras en el entrenamiento posterior y la inferencia, incluyendo una mejor metacognición: el modelo debe primero darse cuenta de que no recuerda algo para activar estrategias de recuperación más profundas.
marsbitHace 9 hora(s)