¿Los modelos generativos también pueden entrenarse de extremo a extremo? El núcleo es un bucle for

marsbitPublished on 2026-08-03Last updated on 2026-08-03

Abstract

El entrenamiento de modelos generativos siempre ha sido un reto debido a la "desviación por exposición" (exposure bias): durante el entrenamiento solo se aprenden pequeños pasos, mientras que la generación requiere cientos de iteraciones, lo que causa acumulación de errores. Esto ha impedido que los modelos generativos sean entrenados de extremo a extremo (end-to-end), a diferencia de otras tareas de aprendizaje profundo. Un reciente artículo de la Universidad de Illinois y Harvard introduce "Explorative Modeling (XM)", un nuevo paradigma que resuelve este problema mediante un bucle simple (for). La idea clave es que, en cada paso de entrenamiento, el modelo genera K candidatos y solo retropropaga el gradiente a partir del candidato más cercano a los datos reales. Este enfoque evita que el modelo converja a un promedio borroso entre múltiples modos (mode blurring), un problema inherente a las funciones de pérdida de reconstrucción típicas. XM identifica una tercera dimensión escalable, además de los parámetros y los datos: la "expresividad generativa". Los experimentos en imágenes, video y lenguaje muestran que aumentar la exploración (K) mejora monótonamente el rendimiento, con ganancias de eficiencia en FLOPs, muestras y parámetros. En tareas de control robótico, una política exploratoria XM iguala o supera a políticas de difusión que requieren 100 veces más cómputo en inferencia. El trabajo sugiere que, a gran escala, la expresividad generativa se convierte en el cuello...

En 2012, AlexNet puso fin a una época con una victoria abrumadora. Antes de eso, el reconocimiento de imágenes requería diseñar manualmente un flujo de extracción de características; AlexNet demostró algo que se ha verificado repetidamente desde entonces: dejar que el modelo aprenda la tarea completa de extremo a extremo casi siempre supera a las canalizaciones en etapas diseñadas cuidadosamente por humanos.

Desde la clasificación de imágenes hasta la detección de objetos y la segmentación de imágenes, detrás de cada salto en el aprendizaje profundo está la misma frase: deja que lo aprenda todo de una vez.

Solo hay un campo que siempre ha sido la excepción: los modelos generativos.

Los modelos generativos más potentes y escalables de hoy (ya sean autorregresivos o de difusión) no son de extremo a extremo.

Durante el entrenamiento, solo aprenden a predecir "un pequeño paso", pero durante la inferencia, tienen que expandir ese paso cientos o miles de veces, como una red recurrente.

El entrenamiento y la inferencia no usan la misma estrategia de muestreo. Esta grieta trae un viejo problema: el error de cada paso se alimenta al siguiente, la entrada se aleja gradualmente de la distribución vista durante el entrenamiento, y el error se acumula capa por capa. En el ámbito académico, esto se llama "sesgo de exposición" (exposure bias).

En otras palabras, la experiencia central del aprendizaje profundo de que "extremo a extremo es mejor" no ha logrado aplicarse realmente a los modelos generativos en más de una década.

Y recientemente, un artículo de la Universidad de Illinois en Urbana-Champaign y la Universidad de Harvard intenta completar esta última pieza del rompecabezas.

Los autores le dan un nombre a este nuevo paradigma: Modelado Exploratorio (Explorative Modeling), abreviado XM. Su idea es tan simple que raya en lo ingenuo, pero apunta a una conclusión audaz: los modelos generativos, además de parámetros y datos, tienen en realidad un tercer eje que se puede ampliar.

Sitio del proyecto: https://explorative-modeling.github.io

Enlace del artículo: https://arxiv.org/abs/2607.27372

Repositorio de código: https://github.com/alexiglad/XM

La raíz del problema: el modelo solo sabe "promediar"

Para entender qué resuelve este artículo, primero hay que entender por qué la generación es difícil.

En el aprendizaje supervisado ordinario (como la clasificación), cada entrada tiene básicamente una única respuesta correcta, y al modelo le basta aprender un mapeo determinista.

Pero la generación es diferente. Le pides al modelo que "genere un perro", y las respuestas correctas pueden ser incluso infinitas. Estas salidas válidas son los distintos modos (picos independientes) de la distribución de datos. La generación es difícil precisamente porque hay que capturar todos estos modos simultáneamente.

El problema es que los modelos generativos principales se entrenan típicamente con una pérdida de reconstrucción (como el error cuadrático). Cuando a una entrada se le asignan aleatoriamente muchos objetivos válidos diferentes, la solución óptima que puede dar la pérdida de reconstrucción es el promedio de esos objetivos. Y para la gran mayoría de los datos, el promedio no está en la variedad de los datos, sino que cae entre varios modos, sin parecerse a ninguno.

La figura en el artículo es muy intuitiva: si el modelo hace regresión directamente de extremo a extremo sin ningún truco, predecirá un solo punto en el medio para tres grupos de puntos dispersos, una foto de un perro se volverá borrosa y una oración degenerará en repetir "the" una y otra vez. Esto es el "desenfoque de modos" (mode blurring), es decir, que la solución óptima es precisamente la respuesta menos parecida a los datos reales.

¿Cómo lo evitan los modelos actuales? La respuesta es descomponer el proceso de "generación". Los modelos autorregresivos predicen solo un elemento a la vez, los de difusión eliminan solo un poco de ruido a la vez, de modo que el objetivo de cada pequeño paso se reduce casi a un solo modo, y así la pérdida de reconstrucción ya no promedia.

Este "desglose del proceso generativo" es precisamente la razón por la que la difusión y los modelos autorregresivos pueden producir muestras de alta calidad, pero también es lo que impide que el modelo sea de extremo a extremo.

De esto, los autores plantean una pregunta clave: un modelo generativo solo tiene dos cosas que se pueden descomponer: cómo generar y cómo entrenar.

Dado que descomponer la generación arruina la naturaleza de extremo a extremo, ¿por qué no descomponer el entrenamiento?

Un bucle for: todo el núcleo del modelado exploratorio

Explorative Modeling descompone precisamente el ciclo de entrenamiento.

Su mecanismo se puede resumir en una oración: en cada paso de entrenamiento, el modelo ya no genera una sola muestra para forzar un objetivo, sino que genera K candidatos, y luego solo selecciona el que esté más cerca de los datos reales para entrenar y propagar el gradiente. En el artículo, lo implementan como un bucle for de 3 a 5 líneas, tan simple que resulta sospechoso (Algoritmo 1).

¿Por qué esto resuelve el desenfoque de modos?

Pongamos un ejemplo de la vida real: adivinar dónde caerán los dardos. Si solo te permiten adivinar una vez, tu estrategia óptima es adivinar la posición promedio de todos los dardos, pero ese punto a menudo es un lugar del tablero donde casi ningún dardo se ha clavado. Pero si te permiten adivinar K veces, y solo se puntúa según la más cercana, la estrategia óptima cambia inmediatamente: dispersarás estas adivinanzas, haciendo que cada una cubra un grupo diferente de puntos de impacto.

Lo mismo ocurre con el modelo. Cuando se le permite explorar K candidatos, diferentes ruidos de entrada "reclamarán" modos diferentes, en lugar de apiñarse todos en el medio para promediar. Cuantas más exploraciones, más modos puede capturar firmemente el modelo.

Los autores le dan un nombre a esta capacidad largamente ignorada: expresividad generativa (generative expressivity), y señalan que está determinada por el propio objetivo de entrenamiento, y que no aumentará por sí sola, sin importar cuánto se amplíen los parámetros y los datos.

Esto también explica un fenómeno extraño observado desde hace tiempo en la industria: ¿por qué los mejores modelos actuales dependen tanto de técnicas de "guía" (guidance)?

La llamada guía sin clasificador (classifier-free guidance) esencialmente empuja la predicción lejos de ese promedio difuso. Pero si el modelo no se difumina por sí solo, ¿para qué empujarlo? El hecho de que la guía sea útil es precisamente la raíz del problema del desenfoque de modos.

El artículo también presenta dos direcciones de exploración: Forward (hacia adelante) y Reverse (hacia atrás). La primera fija un objetivo real y busca el más cercano entre sus generaciones, sesgándose hacia el "recuerdo" (cubrir todos los modos); la segunda fija una generación y busca el más cercano en los datos reales, sesgándose hacia la "precisión", y casi no aumenta el costo computacional, a costa de poder colapsar a unos pocos modos. Ambas son complementarias y se pueden usar en combinación.

El tercer eje: cuanto más se amplía, mayores son los beneficios

La conclusión más importante de este artículo es que valida la "exploración" como un verdadero eje de escalado (scaling axis).

Los autores agregan exploración a modelos de difusión/flujo, modelos Jumpy e incluso modelos de lenguaje de difusión enmascarada, y observan consistentemente mejoras monótonas en el rendimiento en tres modalidades: imagen, video y lenguaje. Lo más crucial es la tendencia de los beneficios con la escala: cuanto más grande, más pronunciados.

Los números que da el artículo son: a medida que crece la escala de datos, la ganancia por exploración aumenta del 7% al 36%; a medida que el modelo se hace más grande, del 13% al 23%; cuando la potencia computacional se triplica, la ganancia de eficiencia más que se duplica.

En cuanto a la eficiencia específica, la exploración mejora la eficiencia de FLOP en 4.1 veces, la eficiencia de muestras en 6.2 veces y la eficiencia de parámetros en un 47%. En la generación de imágenes, lleva la receta actualmente más fuerte, RAE, a un FID de 1.43 sin guía en ImageNet, acercándose al mejor nivel de la industria.

Un modelo Large que explora 5 modos incluso puede superar a un modelo XLarge con un 47% más de parámetros pero sin exploración.

Las implicaciones de esta tendencia no son pequeñas. La explicación de los autores es: a pequeña escala, el modelo está limitado principalmente por parámetros y datos, y la expresividad generativa aún no es el cuello de botella; pero una vez que los parámetros y datos se amplían hasta el punto de que "ya no son una limitación", la expresividad generativa se convierte cada vez más en el verdadero cuello de botella. Y eso es precisamente lo que la exploración puede amplificar directamente.

Dado que el entrenamiento de los modelos base verdaderos actuales utiliza una potencia computacional aproximadamente cuatro órdenes de magnitud mayor que el mayor experimento de este artículo, los autores creen que los números reportados en el artículo probablemente sean solo el límite inferior de los beneficios a mayor escala.

Generación verdaderamente de extremo a extremo

Si se lleva la exploración al límite, ¿qué sucede? La respuesta vuelve al suspenso inicial: los modelos generativos finalmente pueden ser de extremo a extremo.

Los autores utilizan XM como un modelo independiente de extremo a extremo para tareas de control robótico. En clonación de comportamiento (Behavior Cloning), su Explorative Policy iguala o supera a Diffusion Policy (que requiere 100 pases hacia adelante) con solo un pase hacia adelante de la red; en el modelado del mundo orientado a objetivos, Explorative World Model logra un mejor rendimiento promedio que Diffuser, usando entre 16 y 256 veces menos potencia computacional de inferencia.

El origen de esta diferencia es claro: los modelos de difusión intercambian expresividad por cientos de pasos de generación durante la inferencia, mientras que XM de extremo a extremo traslada este costo a la exploración durante el entrenamiento, por lo que la inferencia requiere solo un pase hacia adelante. Para manejar "múltiples modos", la misma tarea se puede descomponer lentamente durante la inferencia o explorar completamente de una vez durante el entrenamiento; este artículo elige lo último.

Sobre los autores

El primer autor de este artículo, Alexi Gladstone, no es desconocido. En julio de 2025, su trabajo principal sobre Transformers Basados en Energía (Energy-Based Transformers, EBT) generó bastante discusión en las redes sociales.

Ese trabajo afirmaba "superar" por primera vez en múltiples dimensiones las curvas de escalado del Transformer de avance estándar, e intentaba generalizar el "pensamiento de Sistema 2" a cualquier modo. Consulte el informe de Machine Heart: "¡Llega un nuevo paradigma! Un nuevo modelo de energía rompe el límite de escalado de Transformer++, con una tasa de escalado de entrenamiento un 35% más rápida".

Explorative Modeling sigue la misma línea de pensamiento que él ha mantenido: cuestionar si "el modelo puede, a través de algún tipo de búsqueda o exploración, hacer cosas que un solo pase hacia adelante no puede". Y este artículo se basa además en otra teoría suya y de sus colaboradores (Yilun Du y Heng Ji) llamada Mode Forcing. El artículo admite que, precisamente porque esa teoría existía primero, la mayoría de los resultados de XM fueron predichos teóricamente y luego verificados experimentalmente, algo poco común en el ámbito del aprendizaje profundo, donde lo normal es "ejecutar experimentos y luego explicar".

Los autores también reconocen honestamente las limitaciones: la idea de best-of-K en sí no es nueva, otros lo han hecho muchas veces antes; su verdadera contribución es haber comprendido claramente qué hace exactamente este simple bucle: amplifica directamente la expresividad generativa sin descomponer el proceso de generación.

Además, los modelos de lenguaje autorregresivos siguen siendo el hueso más duro de roer, el XM Forward puro de extremo a extremo sigue siendo demasiado costoso en distribuciones extremadamente multimodales (como la generación de imágenes), y todo esto queda para trabajos futuros.

Durante más de una década, nos hemos acostumbrado a ajustar los modelos generativos con dos perillas: hacerlos más grandes y alimentarlos con más datos.

La tercera perilla que propone este artículo es bastante simple: dejar que el modelo adivine varias veces y quedarse solo con la mejor. Pero si la tendencia que revela es cierta, entonces, a medida que la escala continúe expandiéndose, las dos primeras perillas eventualmente llegarán a su límite, y la tercera apenas está comenzando a girar.

Enlaces de referencia

https://x.com/AlexiGlad/status/2083230922196107288

Este artículo procede del WeChat público "Machine Heart" (ID: almosthuman2014), autor: Panda

Trending Cryptos

Related Questions

Q¿Qué problema fundamental en los modelos generativos intenta resolver el Explorative Modeling (XM)?

AEl Explorative Modeling (XM) intenta resolver el problema del 'mode blurring' o desenfoque de modas, donde los modelos generativos entrenados con pérdidas de reconstrucción (como el error cuadrático medio) predicen la media de todas las salidas válidas posibles, que a menudo no se parece a ninguna de las muestras reales de datos.

Q¿Cuál es el mecanismo central del Explorative Modeling, descrito como un simple bucle 'for'?

AEl mecanismo central del Explorative Modeling consiste en que, en cada paso de entrenamiento, el modelo genera K candidatos en lugar de uno solo, y luego solo se selecciona y entrena con el candidato que esté más cerca de los datos reales, retropropagando el gradiente únicamente a partir de ese mejor candidato.

Q¿Qué ventaja clave ofrece el enfoque XM en comparación con modelos como los difusivos o autoregresivos en cuanto a la inferencia?

ALa ventaja clave del enfoque XM es que permite una inferencia completamente de extremo a extremo, requiriendo solo un pase hacia adelante (forward pass) de la red neuronal, en lugar de los cientos o miles de pasos iterativos necesarios en modelos difusivos o autoregresivos durante la generación.

QSegún el artículo, ¿qué es la 'expresividad generativa' (generative expressivity) y cómo la amplifica XM?

ALa 'expresividad generativa' es la capacidad inherente de un modelo generativo para capturar múltiples modas (picos independientes) en la distribución de datos. XM la amplifica directamente al permitir que el modelo explore múltiples candidatos durante el entrenamiento, asignando cada uno a una moda diferente, en lugar de colapsar todos hacia un promedio.

Q¿Qué autor principal está detrás de este trabajo y cuál fue su contribución anterior notable mencionada en el artículo?

AEl autor principal es Alexi Gladstone. Su contribución anterior notable mencionada es el desarrollo de los 'Energy-Based Transformers (EBT)', un trabajo que afirmó superar las curvas de escalamiento del Transformer estándar en múltiples dimensiones.

Related Reads

Bitcoin Price Drops to $62,470 as Sellers Retest $63,000 Support Level

Bitcoin's price fell below $63,000 for a second consecutive day on Friday, hitting an intraday low of $62,470. The cryptocurrency later recovered to trade just above $63,000, leaving it nearly flat for the past 24 hours and for August overall, with a weekly loss of 2.6%. The volatility triggered significant liquidations, with $26 million of leveraged long Bitcoin positions liquidated over 24 hours. Market sentiment was further dampened by data showing over $131 million in outflows from spot Bitcoin ETFs for a second straight day, signaling a potential pullback by institutional investors. Adding to the negative pressure, index provider MSCI has proposed new criteria for "non-operating companies" in its global indexes, which could lead to the exclusion of firms holding significant digital assets like Bitcoin on their balance sheets. Companies such as Strategy and Metaplanet could be affected, potentially forcing index-tracking funds to sell their shares. Strategy publicly criticized the proposal, arguing digital assets are legitimate assets and index providers should not dictate what companies can own. Public consultations on MSCI's proposal end September 30, with a final decision expected by October 16. If approved, exclusions could begin in November, potentially triggering sustained institutional selling and damaging a key bridge for Bitcoin adoption in the corporate sector.

cryptonews.ru2h ago

Bitcoin Price Drops to $62,470 as Sellers Retest $63,000 Support Level

cryptonews.ru2h ago

Trading

Spot

Hot Articles

How to Buy CORE

Welcome to HTX.com! We've made purchasing CORE (CORE) simple and convenient. Follow our step-by-step guide to embark on your crypto journey.Step 1: Create Your HTX AccountUse your email or phone number to sign up for a free account on HTX. Experience a hassle-free registration journey and unlock all features.Get My AccountStep 2: Go to Buy Crypto and Choose Your Payment MethodCredit/Debit Card: Use your Visa or Mastercard to buy CORE (CORE) instantly.Balance: Use funds from your HTX account balance to trade seamlessly.Third Parties: We've added popular payment methods such as Google Pay and Apple Pay to enhance convenience.P2P: Trade directly with other users on HTX.Over-the-Counter (OTC): We offer tailor-made services and competitive exchange rates for traders.Step 3: Store Your CORE (CORE)After purchasing your CORE (CORE), store it in your HTX account. Alternatively, you can send it elsewhere via blockchain transfer or use it to trade other cryptocurrencies.Step 4: Trade CORE (CORE)Easily trade CORE (CORE) on HTX's spot market. Simply access your account, select your trading pair, execute your trades, and monitor in real-time. We offer a user-friendly experience for both beginners and seasoned traders.

6.1k Total ViewsPublished 2024.03.29Updated 2026.06.02

How to Buy CORE

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of CORE (CORE) are presented below.

活动图片