En 2012, AlexNet puso fin a una época con una victoria abrumadora. Antes de eso, el reconocimiento de imágenes requería diseñar manualmente un flujo de extracción de características; AlexNet demostró algo que se ha verificado repetidamente desde entonces: dejar que el modelo aprenda la tarea completa de extremo a extremo casi siempre supera a las canalizaciones en etapas diseñadas cuidadosamente por humanos.
Desde la clasificación de imágenes hasta la detección de objetos y la segmentación de imágenes, detrás de cada salto en el aprendizaje profundo está la misma frase: deja que lo aprenda todo de una vez.
Solo hay un campo que siempre ha sido la excepción: los modelos generativos.
Los modelos generativos más potentes y escalables de hoy (ya sean autorregresivos o de difusión) no son de extremo a extremo.
Durante el entrenamiento, solo aprenden a predecir "un pequeño paso", pero durante la inferencia, tienen que expandir ese paso cientos o miles de veces, como una red recurrente.
El entrenamiento y la inferencia no usan la misma estrategia de muestreo. Esta grieta trae un viejo problema: el error de cada paso se alimenta al siguiente, la entrada se aleja gradualmente de la distribución vista durante el entrenamiento, y el error se acumula capa por capa. En el ámbito académico, esto se llama "sesgo de exposición" (exposure bias).
En otras palabras, la experiencia central del aprendizaje profundo de que "extremo a extremo es mejor" no ha logrado aplicarse realmente a los modelos generativos en más de una década.
Y recientemente, un artículo de la Universidad de Illinois en Urbana-Champaign y la Universidad de Harvard intenta completar esta última pieza del rompecabezas.

Los autores le dan un nombre a este nuevo paradigma: Modelado Exploratorio (Explorative Modeling), abreviado XM. Su idea es tan simple que raya en lo ingenuo, pero apunta a una conclusión audaz: los modelos generativos, además de parámetros y datos, tienen en realidad un tercer eje que se puede ampliar.

Sitio del proyecto: https://explorative-modeling.github.io
Enlace del artículo: https://arxiv.org/abs/2607.27372
Repositorio de código: https://github.com/alexiglad/XM
La raíz del problema: el modelo solo sabe "promediar"
Para entender qué resuelve este artículo, primero hay que entender por qué la generación es difícil.
En el aprendizaje supervisado ordinario (como la clasificación), cada entrada tiene básicamente una única respuesta correcta, y al modelo le basta aprender un mapeo determinista.
Pero la generación es diferente. Le pides al modelo que "genere un perro", y las respuestas correctas pueden ser incluso infinitas. Estas salidas válidas son los distintos modos (picos independientes) de la distribución de datos. La generación es difícil precisamente porque hay que capturar todos estos modos simultáneamente.
El problema es que los modelos generativos principales se entrenan típicamente con una pérdida de reconstrucción (como el error cuadrático). Cuando a una entrada se le asignan aleatoriamente muchos objetivos válidos diferentes, la solución óptima que puede dar la pérdida de reconstrucción es el promedio de esos objetivos. Y para la gran mayoría de los datos, el promedio no está en la variedad de los datos, sino que cae entre varios modos, sin parecerse a ninguno.
La figura en el artículo es muy intuitiva: si el modelo hace regresión directamente de extremo a extremo sin ningún truco, predecirá un solo punto en el medio para tres grupos de puntos dispersos, una foto de un perro se volverá borrosa y una oración degenerará en repetir "the" una y otra vez. Esto es el "desenfoque de modos" (mode blurring), es decir, que la solución óptima es precisamente la respuesta menos parecida a los datos reales.

¿Cómo lo evitan los modelos actuales? La respuesta es descomponer el proceso de "generación". Los modelos autorregresivos predicen solo un elemento a la vez, los de difusión eliminan solo un poco de ruido a la vez, de modo que el objetivo de cada pequeño paso se reduce casi a un solo modo, y así la pérdida de reconstrucción ya no promedia.
Este "desglose del proceso generativo" es precisamente la razón por la que la difusión y los modelos autorregresivos pueden producir muestras de alta calidad, pero también es lo que impide que el modelo sea de extremo a extremo.
De esto, los autores plantean una pregunta clave: un modelo generativo solo tiene dos cosas que se pueden descomponer: cómo generar y cómo entrenar.
Dado que descomponer la generación arruina la naturaleza de extremo a extremo, ¿por qué no descomponer el entrenamiento?

Un bucle for: todo el núcleo del modelado exploratorio
Explorative Modeling descompone precisamente el ciclo de entrenamiento.
Su mecanismo se puede resumir en una oración: en cada paso de entrenamiento, el modelo ya no genera una sola muestra para forzar un objetivo, sino que genera K candidatos, y luego solo selecciona el que esté más cerca de los datos reales para entrenar y propagar el gradiente. En el artículo, lo implementan como un bucle for de 3 a 5 líneas, tan simple que resulta sospechoso (Algoritmo 1).

¿Por qué esto resuelve el desenfoque de modos?
Pongamos un ejemplo de la vida real: adivinar dónde caerán los dardos. Si solo te permiten adivinar una vez, tu estrategia óptima es adivinar la posición promedio de todos los dardos, pero ese punto a menudo es un lugar del tablero donde casi ningún dardo se ha clavado. Pero si te permiten adivinar K veces, y solo se puntúa según la más cercana, la estrategia óptima cambia inmediatamente: dispersarás estas adivinanzas, haciendo que cada una cubra un grupo diferente de puntos de impacto.

Lo mismo ocurre con el modelo. Cuando se le permite explorar K candidatos, diferentes ruidos de entrada "reclamarán" modos diferentes, en lugar de apiñarse todos en el medio para promediar. Cuantas más exploraciones, más modos puede capturar firmemente el modelo.

Los autores le dan un nombre a esta capacidad largamente ignorada: expresividad generativa (generative expressivity), y señalan que está determinada por el propio objetivo de entrenamiento, y que no aumentará por sí sola, sin importar cuánto se amplíen los parámetros y los datos.

Esto también explica un fenómeno extraño observado desde hace tiempo en la industria: ¿por qué los mejores modelos actuales dependen tanto de técnicas de "guía" (guidance)?
La llamada guía sin clasificador (classifier-free guidance) esencialmente empuja la predicción lejos de ese promedio difuso. Pero si el modelo no se difumina por sí solo, ¿para qué empujarlo? El hecho de que la guía sea útil es precisamente la raíz del problema del desenfoque de modos.
El artículo también presenta dos direcciones de exploración: Forward (hacia adelante) y Reverse (hacia atrás). La primera fija un objetivo real y busca el más cercano entre sus generaciones, sesgándose hacia el "recuerdo" (cubrir todos los modos); la segunda fija una generación y busca el más cercano en los datos reales, sesgándose hacia la "precisión", y casi no aumenta el costo computacional, a costa de poder colapsar a unos pocos modos. Ambas son complementarias y se pueden usar en combinación.


El tercer eje: cuanto más se amplía, mayores son los beneficios
La conclusión más importante de este artículo es que valida la "exploración" como un verdadero eje de escalado (scaling axis).
Los autores agregan exploración a modelos de difusión/flujo, modelos Jumpy e incluso modelos de lenguaje de difusión enmascarada, y observan consistentemente mejoras monótonas en el rendimiento en tres modalidades: imagen, video y lenguaje. Lo más crucial es la tendencia de los beneficios con la escala: cuanto más grande, más pronunciados.
Los números que da el artículo son: a medida que crece la escala de datos, la ganancia por exploración aumenta del 7% al 36%; a medida que el modelo se hace más grande, del 13% al 23%; cuando la potencia computacional se triplica, la ganancia de eficiencia más que se duplica.
En cuanto a la eficiencia específica, la exploración mejora la eficiencia de FLOP en 4.1 veces, la eficiencia de muestras en 6.2 veces y la eficiencia de parámetros en un 47%. En la generación de imágenes, lleva la receta actualmente más fuerte, RAE, a un FID de 1.43 sin guía en ImageNet, acercándose al mejor nivel de la industria.

Un modelo Large que explora 5 modos incluso puede superar a un modelo XLarge con un 47% más de parámetros pero sin exploración.

Las implicaciones de esta tendencia no son pequeñas. La explicación de los autores es: a pequeña escala, el modelo está limitado principalmente por parámetros y datos, y la expresividad generativa aún no es el cuello de botella; pero una vez que los parámetros y datos se amplían hasta el punto de que "ya no son una limitación", la expresividad generativa se convierte cada vez más en el verdadero cuello de botella. Y eso es precisamente lo que la exploración puede amplificar directamente.
Dado que el entrenamiento de los modelos base verdaderos actuales utiliza una potencia computacional aproximadamente cuatro órdenes de magnitud mayor que el mayor experimento de este artículo, los autores creen que los números reportados en el artículo probablemente sean solo el límite inferior de los beneficios a mayor escala.
Generación verdaderamente de extremo a extremo
Si se lleva la exploración al límite, ¿qué sucede? La respuesta vuelve al suspenso inicial: los modelos generativos finalmente pueden ser de extremo a extremo.
Los autores utilizan XM como un modelo independiente de extremo a extremo para tareas de control robótico. En clonación de comportamiento (Behavior Cloning), su Explorative Policy iguala o supera a Diffusion Policy (que requiere 100 pases hacia adelante) con solo un pase hacia adelante de la red; en el modelado del mundo orientado a objetivos, Explorative World Model logra un mejor rendimiento promedio que Diffuser, usando entre 16 y 256 veces menos potencia computacional de inferencia.


El origen de esta diferencia es claro: los modelos de difusión intercambian expresividad por cientos de pasos de generación durante la inferencia, mientras que XM de extremo a extremo traslada este costo a la exploración durante el entrenamiento, por lo que la inferencia requiere solo un pase hacia adelante. Para manejar "múltiples modos", la misma tarea se puede descomponer lentamente durante la inferencia o explorar completamente de una vez durante el entrenamiento; este artículo elige lo último.
Sobre los autores
El primer autor de este artículo, Alexi Gladstone, no es desconocido. En julio de 2025, su trabajo principal sobre Transformers Basados en Energía (Energy-Based Transformers, EBT) generó bastante discusión en las redes sociales.

Ese trabajo afirmaba "superar" por primera vez en múltiples dimensiones las curvas de escalado del Transformer de avance estándar, e intentaba generalizar el "pensamiento de Sistema 2" a cualquier modo. Consulte el informe de Machine Heart: "¡Llega un nuevo paradigma! Un nuevo modelo de energía rompe el límite de escalado de Transformer++, con una tasa de escalado de entrenamiento un 35% más rápida".

Explorative Modeling sigue la misma línea de pensamiento que él ha mantenido: cuestionar si "el modelo puede, a través de algún tipo de búsqueda o exploración, hacer cosas que un solo pase hacia adelante no puede". Y este artículo se basa además en otra teoría suya y de sus colaboradores (Yilun Du y Heng Ji) llamada Mode Forcing. El artículo admite que, precisamente porque esa teoría existía primero, la mayoría de los resultados de XM fueron predichos teóricamente y luego verificados experimentalmente, algo poco común en el ámbito del aprendizaje profundo, donde lo normal es "ejecutar experimentos y luego explicar".

Los autores también reconocen honestamente las limitaciones: la idea de best-of-K en sí no es nueva, otros lo han hecho muchas veces antes; su verdadera contribución es haber comprendido claramente qué hace exactamente este simple bucle: amplifica directamente la expresividad generativa sin descomponer el proceso de generación.
Además, los modelos de lenguaje autorregresivos siguen siendo el hueso más duro de roer, el XM Forward puro de extremo a extremo sigue siendo demasiado costoso en distribuciones extremadamente multimodales (como la generación de imágenes), y todo esto queda para trabajos futuros.
Durante más de una década, nos hemos acostumbrado a ajustar los modelos generativos con dos perillas: hacerlos más grandes y alimentarlos con más datos.
La tercera perilla que propone este artículo es bastante simple: dejar que el modelo adivine varias veces y quedarse solo con la mejor. Pero si la tendencia que revela es cierta, entonces, a medida que la escala continúe expandiéndose, las dos primeras perillas eventualmente llegarán a su límite, y la tercera apenas está comenzando a girar.
Enlaces de referencia
https://x.com/AlexiGlad/status/2083230922196107288
Este artículo procede del WeChat público "Machine Heart" (ID: almosthuman2014), autor: Panda






