Recientemente hemos informado sobre muchas empresas emergentes y resultados de investigación que apuntan a la dirección del "aprendizaje continuo", como "Mind Lab lanza continuamente los últimos avances de LoRA, emerge un nuevo paradigma para el 'aprendizaje continuo' de modelos grandes", "Adiós a las cadenas de la KV Cache, comprimiendo contextos largos en los pesos, ¿hay esperanza para los modelos grandes de aprendizaje continuo?", "ICML 2026 | ¡Rompiendo límites! La Universidad de Hong Kong propone la primera arquitectura de aprendizaje continuo adaptable a más de 300 tareas, resolviendo el problema del olvido", "¡Harness que permite que DeepSeek se auto-evolucione! El autor de LlamaFactory abre una nueva herramienta: agentes automáticos creados por 0.2 yuanes", "Cuando 'crecer' ya no es el único camino, otro modelo nacional se abre"...
Sí, bastante denso. "Aprendizaje continuo" también se está convirtiendo en una de nuestras palabras clave más frecuentes. Y detrás de esto se manifiesta un juicio que se repite constantemente.
En octubre de 2025, Andrej Karpathy dijo en el podcast de Dwarkesh Patel: los modelos grandes actuales "no tienen aprendizaje continuo. No puedes decirle algo y esperar que lo recuerde". Él cree que solucionar estos defectos cognitivosllevará aproximadamente diez años más. Dos meses después, puso esta frase en un panorama más amplio en su revisión anual: el salto en la capacidad de los modelos en 2025 provino principalmente del aprendizaje por refuerzo con recompensa verificable (RLVR), pero en toda la pila tecnológica LLM, la memoria, la percepción multimodal, el aprendizaje continuo y la capacidad de operar ordenadores siguen siendo deficiencias evidentes, "tenemos prototipos, pero aún no tenemos agentes inteligentes que puedan ser colegas".

Por lo tanto, elAprendizaje Continuo(Continual Learning, también llamadoAprendizaje Permanente/Lifelong Learning) se convirtió en uno de los conceptos más populares del último año.
Se refiere a la capacidad de un modelo, después de su despliegue, de absorber continuamente nuevos conocimientos y experiencias, como lo hace una persona, sin olvidar lo aprendido anteriormente.
Esto suena obvio, pero es extremadamente difícil de lograr, tanto que se convierte en uno de los huesos más duros en el camino hacia el "colega de IA". Y esa serie de informes mencionados anteriormente también muestra que este camino ya no es una sola dirección, sino varias ramas que avanzan simultáneamente.
En torno a cómo hacer que los modelos "aprendan mientras se usan", la academia y la industria se han dividido en varias rutas técnicas diferentes el año pasado. Algunas añaden memoria externa al modelo, otras reescriben continuamente los pesos, otras directamente vuelven a entrenar desde cero, y un grupo más nuevo de ideas intenta redefinir el propio concepto de "aprendizaje". Este artículo intenta desglosar estas direcciones una por una, explicando claramente en qué apuesta cada camino y dónde se atasca.
Primero aclaremos: lo difícil no es "aprender", sino "no olvidar"
El obstáculo central del aprendizaje continuo tiene un nombre específico:olvido catastrófico (catastrophic forgetting). El conocimiento de las redes neuronales se almacena en miles de millones de pesos. Cuando usas nuevos datos para ajustar el modelo (fine-tuning) y actualizar estos pesos, el modelo, mientras aprende una nueva tarea, tiende a sobrescribir la parte de los parámetros que contenía las habilidades anteriores, lo que provoca una caída brusca en el rendimiento de las tareas que antes dominaba.

Diagrama esquemático del olvido catastrófico. Cuando una red neuronal artificial profunda se entrena secuencialmente en dos tareas, olvida rápida y completamente la primera tarea mientras entrena la segunda.
Este fenómeno ya fue ampliamente estudiado en la era de los modelos pequeños, pero en los LLM presenta nuevos problemas. TRACE, un punto de referencia específico para evaluar el aprendizaje continuo en LLM, descubrió que el ajuste continuo de un modelo ya alineado no solo hace que olvide tareas antiguas, sino que también perjudica su capacidad general y su capacidad para seguir instrucciones. En otras palabras, el precio de enseñar algo nuevo al modelo puede ser que se vuelva más tonto en general y menos obediente.
Precisamente porque modificar directamente los pesos conlleva tanto riesgo, el "aprendizaje continuo" se dividió en varias escuelas. Su divergencia fundamental radica en haber tomado diferentes decisiones en los dos problemas de "¿modificar o no los pesos?" y "¿dónde almacenar el nuevo conocimiento?".
Colgando la memoria fuera del modelo
El enfoque más directo y de implementación más rápida es: simplemente no tocar los pesos del modelo, almacenar el nuevo conocimiento en una base de datos externa al modelo y recuperarlo al contexto cuando sea necesario. Esta ruta evolucionó desde RAG (Generación Aumentada por Recuperación) y ahora se ha convertido en un campo especializado:Memoria de Agentes (Agent Memory).
Un trabajo representativo es MemGPT (cuya empresa matriz ahora se llama Letta). Compara la gestión del contexto de un LLM con la gestión de memoria de un sistema operativo, distinguiendo entre el "contexto de trabajo" limitado y un "almacenamiento externo" más grande, permitiendo que el modelo, como un sistema operativo que planifica la memoria, decida qué debe cargarse en el contexto y qué debe archivarse.
A lo largo de esta línea, varios sistemas tienen diferentes énfasis: Mem0 se centra en el acceso a memoria a largo plazo a nivel de producción y escalable; Zep añade a la recuperación un grafo de conocimiento temporal, utilizado para el razonamiento temporal entre sesiones; A-MEM adopta el método de notas de tarjetas (Zettelkasten), etiquetando cada recuerdo con etiquetas estructuradas y vinculándolo automáticamente a entradas antiguas relevantes, haciendo que la recuperación se adapte mejor al contexto.
El propio Karpathy apuesta por esta dirección. Él enfatiza repetidamente que el futuro no necesita una memoria tipo "disco duro más grande", sino un "núcleo cognitivo" (cognitive core, estima que uno o dos mil millones de parámetros son suficientes) más un conjunto de memoria externa estructurada que crezca de manera compuesta por sí misma.
Basándose en esta idea, publicó un patrón llamado "LLM Wiki" en GitHub: ya no se utiliza RAG cada vez para buscar fragmentos de texto originales, sino que se permite que el agente compile activamente los materiales en una base de conocimiento en constante actualización e interconectada, y luego la consulte.

La documentación de LLM Wiki de Karpathy ya ha recibido cerca de 45 mil estrellas y ha sido bifurcada más de 9 mil veces.
Letta mismo elevó esto a la proposición del "aprendizaje continuo en el espacio de tokens". Señalan que la práctica predeterminada actual es "añadir primero, resumir después", es decir, acumular experiencias originales hasta que el contexto se desborda y luego comprimirlas en un resumen. Esto tiene dos defectos: añadir pospone todo el trabajo de representación al momento de la inferencia, y cada propagación hacia adelante debe reprocesar los registros originales; y el resumen es con pérdida y abrupto, detalles importantes desaparecen sin previo aviso. La apuesta de Letta es que en el futuro, los recuerdos aprendidos en el espacio de tokens serán más valiosos que los propios pesos del modelo.
La fortaleza de esta dirección es la seguridad, el control y la explicabilidad, si se comete un error se puede eliminar fácilmente; su debilidad es que en esencia no "internaliza" realmente el conocimiento en el modelo, siempre depende de la recuperación y del cuello de botella del contexto, y una vez que la base de memoria se expande, la precisión de la recuperación y el costo se convierten en cuellos de botella.
Dejar que el contexto mismo evolucione en un "manual de estrategias"
Un paso más allá de la memoria externa hay un conjunto de ideas más refinadas: no modificar los pesos, pero permitir que el contexto de entrada del modelo evolucione continuamente. Esto se llamaIngeniería de Contexto (Context Engineering).
En octubre de 2025, el ACE (Agentic Context Engineering) propuesto por Stanford, SambaNova y UC Berkeley es un representante. Trata el contexto como un "manual de estrategias" (playbook) en constante crecimiento, mantenido por tres roles especializados: Generator se encarga de generar trayectorias de razonamiento, Reflector extrae experiencias concretas de éxitos y fracasos, y Curator organiza estas experiencias en actualizaciones incrementales estructuradas que se fusionan en el manual.

ACE busca resolver dos problemas comunes en métodos similares. Uno es la "preferencia por la brevedad" (brevity bias): cuando se pide a un LLM que reescriba el contexto repetidamente, tiende a comprimir y perder detalles específicos del dominio; el otro es el "colapso del contexto" (context collapse): la reescritura repetida hace que los detalles se pierdan gradualmente.
ACE evita estos dos puntos utilizando pequeños cambios incrementales (delta updates) en lugar de reescribir secciones completas. Según los datos del artículo, ACE mejora las tareas de agente en un 10,6% y el razonamiento financiero en un 8,6% en comparación con la línea base, mientras reduce la latencia de adaptación en aproximadamente un 86,9%; en la lista AppWorld, utilizando el modelo de código abierto más pequeño DeepSeek-V3.1 con ACE, la puntuación promedio puede igualar a los agentes de nivel de producción basados en GPT-4.1 como IBM CUGA.
Vale la pena señalar que ACE enfatiza que puede funcionar sin supervisión etiquetada; se basa en señales de retroalimentación generadas naturalmente durante la ejecución (por ejemplo, si el código funciona o da error) para guiar la reflexión y organización. Esto la conecta con la narrativa más amplia de "los agentes aprenden de su propia experiencia".
Entrenamiento posterior continuo: modificar los pesos, pero de manera inteligente
La memoria externa y la ingeniería de contexto evitan el riesgo de modificar pesos, pero también evitan la verdadera internalización del conocimiento. Otro grupo de investigadores cree que, a largo plazo, algunos conocimientos y habilidades eventualmente deben escribirse en los parámetros para ser útiles. Esto es elEntrenamiento Posterior Continuo (Continual Post-training), que se divide principalmente en etapas como el ajuste de instrucciones continuo y la alineación de preferencias continua.
John Schulman de Thinking Machines ofrece una visión jerárquica: compara el aprendizaje con tipos de aprendizaje motor, memoria episódica y memoria procedimental en psicología, creyendo que el aprendizaje en contexto continuará manejando tareas de aprendizaje a corto plazo, mientras que el ajuste de parámetros (incluyendo métodos como LoRA) se superpondrá, siendo especialmente adecuado para tareas que requieren mayor capacidad y la verdadera absorción de conocimiento: cuando el lapso de tiempo es largo y el aprendizaje en contexto no es suficiente, el ajuste de parámetros gana.
El mayor enemigo de esta ruta sigue siendo el olvido catastrófico, y una solución interesante reciente proviene de Tinker de Thinking Machines.

Tinker es su primer producto, lanzado en octubre de 2025, una API de ajuste basada en LoRA que abstrae la complejidad del entrenamiento distribuido, exponiendo solo primitivas de bajo nivel como forward_backward, optim_step, permitiendo a los investigadores centrarse en datos y algoritmos.
En aprendizaje continuo, promueven una receta llamada Ajuste por Auto-Destilación (SDFT): la idea central es que el ajuste supervisado ordinario es "fuera de política" (off-policy), el modelo se ve obligado a imitar tokens que por sí mismo no generaría, por lo que cada nueva habilidad aprendida erosiona las antiguas; SDFT permite que el modelo actúe como su propio maestro, aprendiendo nuevas habilidades a partir de demostraciones sin olvidar las antiguas. Una startup llamada Trajectory ya utiliza Tinker como infraestructura central para su plataforma de aprendizaje continuo.
Por cierto, Tinker utiliza LoRA en lugar del ajuste completo, lo que tiene una ventaja práctica: múltiples tareas de ajuste pueden compartir el mismo grupo de recursos computacionales, diluyendo el costo. Esto también explica por qué el "aprendizaje continuo como servicio" se está convirtiendo en un negocio: convertir las actualizaciones frecuentes del modelo en una API bajo demanda es precisamente el intento actual de la industria.
Reentrenamiento y Preentrenamiento Continuo
Si el entrenamiento posterior es "cortar" en la "superficie" del modelo, entonces elPreentrenamiento Continuo (Continual Pre-training, CPT) es volver a la base, continuar preentrenando el modelo con nuevos corpus para que se adapte a nuevos dominios, idiomas o distribuciones de conocimiento que cambian con el tiempo. En comparación con mezclar datos antiguos y nuevos y reentrenar desde cero, CPT se construye sobre la base de un modelo existente, siendo computacionalmente mucho más económico.
Tiene tres usos típicos: conocimiento que cambia con el tiempo, expansión entre idiomas, adaptación entre dominios. Pero el costo también es claro: múltiples estudios empíricos muestran repetidamente que el preentrenamiento continuo tiene un alto costo computacional y tiende a desencadenar olvido catastrófico del conocimiento ya aprendido. Por lo tanto, la academia ha estado buscando métodos de preentrenamiento continuo "sin repetición, sin etiquetado de tareas", tratando de lograr la no-olvido a escala LLM.
Para la gran mayoría de las empresas, el costo de reentrenar desde cero un modelo de vanguardia es tan alto que no es realista, de ahí viene el comentario de Karpathy de que "los modelos grandes no son adecuados para reentrenamientos frecuentes". Por lo tanto, el "reentrenamiento" en sentido estricto es más una opción interna de laboratorios de vanguardia, mientras que el preentrenamiento continuo es un compromiso más factible.
Nuevas ideas: permitir que el modelo aprenda a modificarse a sí mismo
Las cuatro direcciones anteriores, en mayor o menor medida, siguen girando en el marco binario de "externo vs. modificar pesos". Pero un nuevo grupo de trabajos que ha surgido en el último año intenta salir de este marco, redefiniendo elaprendizaje en sí mismo.
Una línea de pensamiento es permitir que el modelo genere sus propios datos de entrenamiento y decida cómo actualizarse a sí mismo.
ElSEAL (Self-Adapting Language Models) del MIT es típico. Dada una nueva entrada, el modelo genera una "autoedición" (self-edit); esta es una instrucción en lenguaje natural que especifica cómo reconstruir la información, qué hiperparámetros usar para actualizar los pesos, e incluso qué herramientas llamar para aumentar los datos; luego el modelo se ajusta a sí mismo basándose en esto, formando una actualización de pesos persistente. Y qué tipo de autoedición es efectiva se entrena mediante un ciclo externo de aprendizaje por refuerzo, siendo la señal de recompensa el desempeño del modelo actualizado en tareas posteriores.

La versión de NeurIPS 2025 demuestra además que esta capacidad de auto-adaptación aumenta con el tamaño del modelo, y utiliza aprendizaje por refuerzo para aliviar el olvido. Sus autores visualizan un tipo de modelo que puede decidir por sí mismo durante el razonamiento "¿debo aprender ahora?", destilando una cadena de pensamiento única en una habilidad permanente.
Otra línea más radical proviene delAprendizaje Anidado (Nested Learning) de Google, presentado en NeurIPS 2025. Su núcleo es reinterpretar un modelo como un conjunto de problemas de optimización anidados en múltiples niveles, cada uno con diferentes "flujos de contexto" y frecuencias de actualización: en esta perspectiva, la arquitectura y el algoritmo de optimización se unifican como diferentes niveles de la misma cosa.

Como prueba de concepto, crearon una arquitectura de auto-modificación llamada Hope, que extiende la arquitectura de memoria a largo plazo Titans en dos aspectos: niveles de aprendizaje anidado sin límite superior y un sistema de "memoria continua" (CMS). En pocas palabras, ya no es solo una división memoria a corto/largo plazo, sino un espectro completo de módulos de memoria que se actualizan en diferentes escalas de tiempo.

En experimentos, Hope supera a los Transformers estándar y a los modelos recursivos modernos en tareas de modelado de lenguaje, razonamiento de contexto largo y aprendizaje continuo. Curiosamente, trabajos posteriores introdujeron una fase de "sueño" en este tipo de arquitectura, permitiendo que el modelo, como los humanos consolidan recuerdos durante el sueño, dedique recursos computacionales entre sesiones activas para destilar abstracciones útiles en recuerdos de parámetros más duraderos.
En un nivel de abstracción aún mayor, está la narrativa de "Era de la Experiencia" propuesta por David Silver y Richard Sutton.

Su juicio es: en campos clave como matemáticas, código, ciencia, el conocimiento extraíble de datos humanos está acercándose a su límite; para avanzar, la IA debe aprender continuamente de la experiencia generada por su interacción con el entorno, formando un ciclo cerrado de auto-suministro de datos. Ven el AlphaProof de DeepMind de 2024 (que obtuvo una medalla IMO mediante "interacción continua con sistemas de demostración formal") como el comienzo de esta era. Esta narrativa vincula el aprendizaje continuo con el aprendizaje por refuerzo y la exploración autónoma de agentes, y plantea un problema aún no resuelto:¿quién diseña esas funciones de recompensa que convierten señales crudas en guías útiles?.
Además, hay una dirección cercana que a menudo se confunde con el aprendizaje continuo pero tiene objetivos diferentes:Edición de Conocimiento (Knowledge Editing). Representado por ROME, MEMIT, logra actualizaciones precisas de hechos individuales o por lotes localizando y modificando las capas MLP que almacenan hechos específicos, sin necesidad de reentrenamiento completo. Pero su objetivo es diferente al del aprendizaje continuo: la edición de conocimiento busca cubrir con precisión un hecho específico; en escenarios de edición secuencial y de por vida, las modificaciones repetidas de parámetros interfieren entre sí, acumulando gradualmente "toxicidad" que lleva al colapso del modelo, lo que también ha generado un grupo de métodos como WISE, AlphaEdit específicamente diseñados para ediciones secuenciales.

Conclusión
Al observar juntas estas varias direcciones, se descubre que en realidad están dispuestas a lo largo de un eje: "¿dónde existe el conocimiento?".

El extremo más externo es la memoria externa y la ingeniería de contexto, donde el conocimiento existe completamente en el espacio de tokens fuera del modelo, seguro y controlable pero sin internalización real; en el medio está el entrenamiento posterior continuo y el preentrenamiento continuo, donde el conocimiento se escribe en los pesos, con mayor límite de capacidad pero enfrentando directamente el olvido catastrófico; el más interno y vanguardista es el grupo de nuevas ideas que permiten la auto-modificación y auto-evolución del modelo, intentando convertir el acto de "aprender" en parte de la capacidad del modelo.
Una observación pragmática es: es probable que estas direcciones no sean mutuamente excluyentes, sino que colaboren en capas. La visión de aprendizaje jerárquico de Schulman, la idea de "núcleo cognitivo + memoria externa" de Karpathy, esencialmente dicen lo mismo:el conocimiento a corto plazo y volátil se maneja con contexto y memoria externa, las habilidades a largo plazo que necesitan sedimentación se dejan al ajuste de parámetros, cada uno con su función. Que ACE pueda evolucionar sin supervisión basándose en retroalimentación de ejecución, que SEAL use aprendizaje por refuerzo para optimizar la autoedición, ambos sugieren una tendencia común: es probable que en el futuro, el aprendizaje continuo permita que el modelo mismo dirija "qué aprender y cómo aprenderlo".
Volviendo entonces al juicio de Karpathy de que "faltan diez años", ¿se ha resuelto o no el aprendizaje continuo? La respuesta probablemente sea: aún no, pero ya no es un espacio vacío. El obstáculo central del olvido catastrófico aún no se ha superado por completo; métodos como SDFT, aprendizaje anidado aún solo "alivian" en lugar de "eliminar" el problema. ¿Puede un mejor manejo del contexto más ajuste resolver el aprendizaje continuo por sí solo, o se necesita una idea completamente nueva? Ni el propio Schulman tiene una respuesta definitiva para esta pregunta más fundamental.
Lo que sí es seguro es que, desde 2025 hasta 2026, el aprendizaje continuo pasó de ser una "capacidad ausente" repetidamente mencionada, a un campo de batalla activo con múltiples rutas y empresas emergentes comenzando a desarrollar productos. Vale la pena seguir observando qué ruta podrá convertir primero al "colega de IA" de prototipo en realidad.
Enlaces de referencia
https://www.lesswrong.com/posts/qBsj6HswdmP6ahaGB/andrej-karpathy-on-llm-cognitive-deficits
https://karpathy.bearblog.dev/year-in-review-2025/
https://www.letta.com/blog/continual-learning/
https://arxiv.org/abs/2510.04618
https://arxiv.org/abs/2402.01364
https://thinkingmachines.ai/tinker/
https://arxiv.org/pdf/2604.05096
https://arxiv.org/pdf/2606.03979
Este artículo proviene de la cuenta de WeChat "机器之心" (ID:almosthuman2014), autor: 持续学习的机器之心, editor: Panda





