¿Los modelos generativos también pueden entrenarse de extremo a extremo? El núcleo es un bucle for

marsbitPublié le 2026-08-03Dernière mise à jour le 2026-08-03

Résumé

El entrenamiento de modelos generativos siempre ha sido un reto debido a la "desviación por exposición" (exposure bias): durante el entrenamiento solo se aprenden pequeños pasos, mientras que la generación requiere cientos de iteraciones, lo que causa acumulación de errores. Esto ha impedido que los modelos generativos sean entrenados de extremo a extremo (end-to-end), a diferencia de otras tareas de aprendizaje profundo. Un reciente artículo de la Universidad de Illinois y Harvard introduce "Explorative Modeling (XM)", un nuevo paradigma que resuelve este problema mediante un bucle simple (for). La idea clave es que, en cada paso de entrenamiento, el modelo genera K candidatos y solo retropropaga el gradiente a partir del candidato más cercano a los datos reales. Este enfoque evita que el modelo converja a un promedio borroso entre múltiples modos (mode blurring), un problema inherente a las funciones de pérdida de reconstrucción típicas. XM identifica una tercera dimensión escalable, además de los parámetros y los datos: la "expresividad generativa". Los experimentos en imágenes, video y lenguaje muestran que aumentar la exploración (K) mejora monótonamente el rendimiento, con ganancias de eficiencia en FLOPs, muestras y parámetros. En tareas de control robótico, una política exploratoria XM iguala o supera a políticas de difusión que requieren 100 veces más cómputo en inferencia. El trabajo sugiere que, a gran escala, la expresividad generativa se convierte en el cuello...

En 2012, AlexNet puso fin a una época con una victoria abrumadora. Antes de eso, el reconocimiento de imágenes requería diseñar manualmente un flujo de extracción de características; AlexNet demostró algo que se ha verificado repetidamente desde entonces: dejar que el modelo aprenda la tarea completa de extremo a extremo casi siempre supera a las canalizaciones en etapas diseñadas cuidadosamente por humanos.

Desde la clasificación de imágenes hasta la detección de objetos y la segmentación de imágenes, detrás de cada salto en el aprendizaje profundo está la misma frase: deja que lo aprenda todo de una vez.

Solo hay un campo que siempre ha sido la excepción: los modelos generativos.

Los modelos generativos más potentes y escalables de hoy (ya sean autorregresivos o de difusión) no son de extremo a extremo.

Durante el entrenamiento, solo aprenden a predecir "un pequeño paso", pero durante la inferencia, tienen que expandir ese paso cientos o miles de veces, como una red recurrente.

El entrenamiento y la inferencia no usan la misma estrategia de muestreo. Esta grieta trae un viejo problema: el error de cada paso se alimenta al siguiente, la entrada se aleja gradualmente de la distribución vista durante el entrenamiento, y el error se acumula capa por capa. En el ámbito académico, esto se llama "sesgo de exposición" (exposure bias).

En otras palabras, la experiencia central del aprendizaje profundo de que "extremo a extremo es mejor" no ha logrado aplicarse realmente a los modelos generativos en más de una década.

Y recientemente, un artículo de la Universidad de Illinois en Urbana-Champaign y la Universidad de Harvard intenta completar esta última pieza del rompecabezas.

Los autores le dan un nombre a este nuevo paradigma: Modelado Exploratorio (Explorative Modeling), abreviado XM. Su idea es tan simple que raya en lo ingenuo, pero apunta a una conclusión audaz: los modelos generativos, además de parámetros y datos, tienen en realidad un tercer eje que se puede ampliar.

Sitio del proyecto: https://explorative-modeling.github.io

Enlace del artículo: https://arxiv.org/abs/2607.27372

Repositorio de código: https://github.com/alexiglad/XM

La raíz del problema: el modelo solo sabe "promediar"

Para entender qué resuelve este artículo, primero hay que entender por qué la generación es difícil.

En el aprendizaje supervisado ordinario (como la clasificación), cada entrada tiene básicamente una única respuesta correcta, y al modelo le basta aprender un mapeo determinista.

Pero la generación es diferente. Le pides al modelo que "genere un perro", y las respuestas correctas pueden ser incluso infinitas. Estas salidas válidas son los distintos modos (picos independientes) de la distribución de datos. La generación es difícil precisamente porque hay que capturar todos estos modos simultáneamente.

El problema es que los modelos generativos principales se entrenan típicamente con una pérdida de reconstrucción (como el error cuadrático). Cuando a una entrada se le asignan aleatoriamente muchos objetivos válidos diferentes, la solución óptima que puede dar la pérdida de reconstrucción es el promedio de esos objetivos. Y para la gran mayoría de los datos, el promedio no está en la variedad de los datos, sino que cae entre varios modos, sin parecerse a ninguno.

La figura en el artículo es muy intuitiva: si el modelo hace regresión directamente de extremo a extremo sin ningún truco, predecirá un solo punto en el medio para tres grupos de puntos dispersos, una foto de un perro se volverá borrosa y una oración degenerará en repetir "the" una y otra vez. Esto es el "desenfoque de modos" (mode blurring), es decir, que la solución óptima es precisamente la respuesta menos parecida a los datos reales.

¿Cómo lo evitan los modelos actuales? La respuesta es descomponer el proceso de "generación". Los modelos autorregresivos predicen solo un elemento a la vez, los de difusión eliminan solo un poco de ruido a la vez, de modo que el objetivo de cada pequeño paso se reduce casi a un solo modo, y así la pérdida de reconstrucción ya no promedia.

Este "desglose del proceso generativo" es precisamente la razón por la que la difusión y los modelos autorregresivos pueden producir muestras de alta calidad, pero también es lo que impide que el modelo sea de extremo a extremo.

De esto, los autores plantean una pregunta clave: un modelo generativo solo tiene dos cosas que se pueden descomponer: cómo generar y cómo entrenar.

Dado que descomponer la generación arruina la naturaleza de extremo a extremo, ¿por qué no descomponer el entrenamiento?

Un bucle for: todo el núcleo del modelado exploratorio

Explorative Modeling descompone precisamente el ciclo de entrenamiento.

Su mecanismo se puede resumir en una oración: en cada paso de entrenamiento, el modelo ya no genera una sola muestra para forzar un objetivo, sino que genera K candidatos, y luego solo selecciona el que esté más cerca de los datos reales para entrenar y propagar el gradiente. En el artículo, lo implementan como un bucle for de 3 a 5 líneas, tan simple que resulta sospechoso (Algoritmo 1).

¿Por qué esto resuelve el desenfoque de modos?

Pongamos un ejemplo de la vida real: adivinar dónde caerán los dardos. Si solo te permiten adivinar una vez, tu estrategia óptima es adivinar la posición promedio de todos los dardos, pero ese punto a menudo es un lugar del tablero donde casi ningún dardo se ha clavado. Pero si te permiten adivinar K veces, y solo se puntúa según la más cercana, la estrategia óptima cambia inmediatamente: dispersarás estas adivinanzas, haciendo que cada una cubra un grupo diferente de puntos de impacto.

Lo mismo ocurre con el modelo. Cuando se le permite explorar K candidatos, diferentes ruidos de entrada "reclamarán" modos diferentes, en lugar de apiñarse todos en el medio para promediar. Cuantas más exploraciones, más modos puede capturar firmemente el modelo.

Los autores le dan un nombre a esta capacidad largamente ignorada: expresividad generativa (generative expressivity), y señalan que está determinada por el propio objetivo de entrenamiento, y que no aumentará por sí sola, sin importar cuánto se amplíen los parámetros y los datos.

Esto también explica un fenómeno extraño observado desde hace tiempo en la industria: ¿por qué los mejores modelos actuales dependen tanto de técnicas de "guía" (guidance)?

La llamada guía sin clasificador (classifier-free guidance) esencialmente empuja la predicción lejos de ese promedio difuso. Pero si el modelo no se difumina por sí solo, ¿para qué empujarlo? El hecho de que la guía sea útil es precisamente la raíz del problema del desenfoque de modos.

El artículo también presenta dos direcciones de exploración: Forward (hacia adelante) y Reverse (hacia atrás). La primera fija un objetivo real y busca el más cercano entre sus generaciones, sesgándose hacia el "recuerdo" (cubrir todos los modos); la segunda fija una generación y busca el más cercano en los datos reales, sesgándose hacia la "precisión", y casi no aumenta el costo computacional, a costa de poder colapsar a unos pocos modos. Ambas son complementarias y se pueden usar en combinación.

El tercer eje: cuanto más se amplía, mayores son los beneficios

La conclusión más importante de este artículo es que valida la "exploración" como un verdadero eje de escalado (scaling axis).

Los autores agregan exploración a modelos de difusión/flujo, modelos Jumpy e incluso modelos de lenguaje de difusión enmascarada, y observan consistentemente mejoras monótonas en el rendimiento en tres modalidades: imagen, video y lenguaje. Lo más crucial es la tendencia de los beneficios con la escala: cuanto más grande, más pronunciados.

Los números que da el artículo son: a medida que crece la escala de datos, la ganancia por exploración aumenta del 7% al 36%; a medida que el modelo se hace más grande, del 13% al 23%; cuando la potencia computacional se triplica, la ganancia de eficiencia más que se duplica.

En cuanto a la eficiencia específica, la exploración mejora la eficiencia de FLOP en 4.1 veces, la eficiencia de muestras en 6.2 veces y la eficiencia de parámetros en un 47%. En la generación de imágenes, lleva la receta actualmente más fuerte, RAE, a un FID de 1.43 sin guía en ImageNet, acercándose al mejor nivel de la industria.

Un modelo Large que explora 5 modos incluso puede superar a un modelo XLarge con un 47% más de parámetros pero sin exploración.

Las implicaciones de esta tendencia no son pequeñas. La explicación de los autores es: a pequeña escala, el modelo está limitado principalmente por parámetros y datos, y la expresividad generativa aún no es el cuello de botella; pero una vez que los parámetros y datos se amplían hasta el punto de que "ya no son una limitación", la expresividad generativa se convierte cada vez más en el verdadero cuello de botella. Y eso es precisamente lo que la exploración puede amplificar directamente.

Dado que el entrenamiento de los modelos base verdaderos actuales utiliza una potencia computacional aproximadamente cuatro órdenes de magnitud mayor que el mayor experimento de este artículo, los autores creen que los números reportados en el artículo probablemente sean solo el límite inferior de los beneficios a mayor escala.

Generación verdaderamente de extremo a extremo

Si se lleva la exploración al límite, ¿qué sucede? La respuesta vuelve al suspenso inicial: los modelos generativos finalmente pueden ser de extremo a extremo.

Los autores utilizan XM como un modelo independiente de extremo a extremo para tareas de control robótico. En clonación de comportamiento (Behavior Cloning), su Explorative Policy iguala o supera a Diffusion Policy (que requiere 100 pases hacia adelante) con solo un pase hacia adelante de la red; en el modelado del mundo orientado a objetivos, Explorative World Model logra un mejor rendimiento promedio que Diffuser, usando entre 16 y 256 veces menos potencia computacional de inferencia.

El origen de esta diferencia es claro: los modelos de difusión intercambian expresividad por cientos de pasos de generación durante la inferencia, mientras que XM de extremo a extremo traslada este costo a la exploración durante el entrenamiento, por lo que la inferencia requiere solo un pase hacia adelante. Para manejar "múltiples modos", la misma tarea se puede descomponer lentamente durante la inferencia o explorar completamente de una vez durante el entrenamiento; este artículo elige lo último.

Sobre los autores

El primer autor de este artículo, Alexi Gladstone, no es desconocido. En julio de 2025, su trabajo principal sobre Transformers Basados en Energía (Energy-Based Transformers, EBT) generó bastante discusión en las redes sociales.

Ese trabajo afirmaba "superar" por primera vez en múltiples dimensiones las curvas de escalado del Transformer de avance estándar, e intentaba generalizar el "pensamiento de Sistema 2" a cualquier modo. Consulte el informe de Machine Heart: "¡Llega un nuevo paradigma! Un nuevo modelo de energía rompe el límite de escalado de Transformer++, con una tasa de escalado de entrenamiento un 35% más rápida".

Explorative Modeling sigue la misma línea de pensamiento que él ha mantenido: cuestionar si "el modelo puede, a través de algún tipo de búsqueda o exploración, hacer cosas que un solo pase hacia adelante no puede". Y este artículo se basa además en otra teoría suya y de sus colaboradores (Yilun Du y Heng Ji) llamada Mode Forcing. El artículo admite que, precisamente porque esa teoría existía primero, la mayoría de los resultados de XM fueron predichos teóricamente y luego verificados experimentalmente, algo poco común en el ámbito del aprendizaje profundo, donde lo normal es "ejecutar experimentos y luego explicar".

Los autores también reconocen honestamente las limitaciones: la idea de best-of-K en sí no es nueva, otros lo han hecho muchas veces antes; su verdadera contribución es haber comprendido claramente qué hace exactamente este simple bucle: amplifica directamente la expresividad generativa sin descomponer el proceso de generación.

Además, los modelos de lenguaje autorregresivos siguen siendo el hueso más duro de roer, el XM Forward puro de extremo a extremo sigue siendo demasiado costoso en distribuciones extremadamente multimodales (como la generación de imágenes), y todo esto queda para trabajos futuros.

Durante más de una década, nos hemos acostumbrado a ajustar los modelos generativos con dos perillas: hacerlos más grandes y alimentarlos con más datos.

La tercera perilla que propone este artículo es bastante simple: dejar que el modelo adivine varias veces y quedarse solo con la mejor. Pero si la tendencia que revela es cierta, entonces, a medida que la escala continúe expandiéndose, las dos primeras perillas eventualmente llegarán a su límite, y la tercera apenas está comenzando a girar.

Enlaces de referencia

https://x.com/AlexiGlad/status/2083230922196107288

Este artículo procede del WeChat público "Machine Heart" (ID: almosthuman2014), autor: Panda

Cryptos en tendance

Questions liées

Q¿Qué problema fundamental en los modelos generativos intenta resolver el Explorative Modeling (XM)?

AEl Explorative Modeling (XM) intenta resolver el problema del 'mode blurring' o desenfoque de modas, donde los modelos generativos entrenados con pérdidas de reconstrucción (como el error cuadrático medio) predicen la media de todas las salidas válidas posibles, que a menudo no se parece a ninguna de las muestras reales de datos.

Q¿Cuál es el mecanismo central del Explorative Modeling, descrito como un simple bucle 'for'?

AEl mecanismo central del Explorative Modeling consiste en que, en cada paso de entrenamiento, el modelo genera K candidatos en lugar de uno solo, y luego solo se selecciona y entrena con el candidato que esté más cerca de los datos reales, retropropagando el gradiente únicamente a partir de ese mejor candidato.

Q¿Qué ventaja clave ofrece el enfoque XM en comparación con modelos como los difusivos o autoregresivos en cuanto a la inferencia?

ALa ventaja clave del enfoque XM es que permite una inferencia completamente de extremo a extremo, requiriendo solo un pase hacia adelante (forward pass) de la red neuronal, en lugar de los cientos o miles de pasos iterativos necesarios en modelos difusivos o autoregresivos durante la generación.

QSegún el artículo, ¿qué es la 'expresividad generativa' (generative expressivity) y cómo la amplifica XM?

ALa 'expresividad generativa' es la capacidad inherente de un modelo generativo para capturar múltiples modas (picos independientes) en la distribución de datos. XM la amplifica directamente al permitir que el modelo explore múltiples candidatos durante el entrenamiento, asignando cada uno a una moda diferente, en lugar de colapsar todos hacia un promedio.

Q¿Qué autor principal está detrás de este trabajo y cuál fue su contribución anterior notable mencionada en el artículo?

AEl autor principal es Alexi Gladstone. Su contribución anterior notable mencionada es el desarrollo de los 'Energy-Based Transformers (EBT)', un trabajo que afirmó superar las curvas de escalamiento del Transformer estándar en múltiples dimensiones.

Lectures associées

Grayscale : « Si les propositions sont adoptées, les prix de ces deux altcoins pourraient augmenter »

Zach Pandl, responsable de la recherche chez Grayscale, estime que des modifications envisagées de la tokenomique d'Ethereum (ETH) et de Solana (SOL) pourraient ralentir considérablement la croissance de leur offre, exerçant ainsi une pression haussière sur leurs prix. Ces propositions visent à réduire le taux d'inflation annuel des jetons ETH et SOL. Un ralentissement de la création de nouveaux jetons augmenterait la rareté des actifs existants. Grayscale prévoit que, si elles sont adoptées, l'inflation annuelle de l'offre d'Ethereum pourrait tomber à environ 0,4% d'ici fin 2031, se rapprochant ainsi du Bitcoin, tandis que celle de Solana pourrait atteindre environ 1,1%. En comparaison, l'offre d'or croît d'environ 1,8% par an et l'inflation (IPC) aux États-Unis est d'environ 3,3%. Pandl note que les propositions pour Solana semblent rencontrer un soutien plus large et ont donc une probabilité de mise en œuvre plus élevée. Cependant, il souligne un compromis potentiel : une inflation réduite pourrait diminuer les récompenses pour les investisseurs pratiquant le staking, une partie importante de leurs revenus provenant de l'émission de nouveaux jetons. En conclusion, un ralentissement de l'offre pourrait profiter aux prix des deux actifs, les détenteurs de jetons sans staking étant particulièrement bien placés pour en bénéficier. Ces changements restent à l'étude et ne sont pas encore approuvés.

cryptonews.ruIl y a 1 h

Grayscale : « Si les propositions sont adoptées, les prix de ces deux altcoins pourraient augmenter »

cryptonews.ruIl y a 1 h

Les experts ont nommé les raisons de la chute du bitcoin après la baisse de l'inflation aux États-Unis

Les données favorables sur l’inflation aux États‑Unis n’ont pas réussi à soutenir le bitcoin. Selon les analystes de CryptoQuant, la principale raison est la faible demande sur le marché au comptant. Le bitcoin n’a pas réagi aux chiffres de l’inflation de juillet, publiés le 12 août, et a même légèrement baissé, passant d’environ 64 500 $ à près de 63 000 $. Pourtant, l’indice des prix à la production (PPI) était meilleur que prévu. Alors que les rendements des obligations du Trésor américain ont reculé et que les marchés actions ont progressé, le bitcoin est resté dans une fourchette de 63 000 à 64 000 $. Cette absence de réaction s’explique notamment par la faible demande au comptant : les entrées de capitaux dans les ETF américains spot de bitcoin restent limitées, et l’indice Coinbase Premium (reflétant l’écart de prix entre Coinbase et les autres grandes plateformes) est négatif depuis mai, indiquant une pression d’achat modérée de la part des investisseurs américains. Dans le même temps, le positionnement des traders sur le marché à terme reste élevé, créant un déséquilibre entre une faible liquidité, une demande spot atone et un volume important de positions à effet de levier. Les analystes estiment que dans ces conditions, même des nouvelles macroéconomiques positives pourraient ne pas déclencher de hausse. Si le prix n’évolue pas malgré un contexte favorable, les traders pourraient commencer à clôturer leurs positions longues à effet de levier, ce qui exercerait une pression supplémentaire à la baisse. Un niveau de résistance clé se situe autour de 68 700 $, coût moyen approximatif pour les détenteurs à court terme, au‑delà duquel une prise de bénéfices est possible. Pour CryptoQuant, une reprise soutenue nécessiterait : une reprise des entrées dans les ETF américains, un retour de l’indice Coinbase Premium en territoire positif, une hausse des volumes de trading au comptant et un franchissement stable des 68 700 $.

cryptonews.ruIl y a 2 h

Les experts ont nommé les raisons de la chute du bitcoin après la baisse de l'inflation aux États-Unis

cryptonews.ruIl y a 2 h

Trading

Spot

Articles tendance

Comment acheter CORE

Bienvenue sur HTX.com ! Nous vous permettons d'acheter CORE (CORE) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément CORE (CORE).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos CORE (CORE)Après avoir acheté vos CORE (CORE), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des CORE (CORE)Tradez facilement CORE (CORE) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

538 vues totalesPublié le 2024.12.13Mis à jour le 2026.06.02

Comment acheter CORE

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de CORE (CORE) sont présentées ci-dessous.

活动图片