¿Los modelos generativos también pueden entrenarse de extremo a extremo? El núcleo es un bucle for

marsbitPublicado a 2026-08-03Actualizado a 2026-08-03

Resumen

El entrenamiento de modelos generativos siempre ha sido un reto debido a la "desviación por exposición" (exposure bias): durante el entrenamiento solo se aprenden pequeños pasos, mientras que la generación requiere cientos de iteraciones, lo que causa acumulación de errores. Esto ha impedido que los modelos generativos sean entrenados de extremo a extremo (end-to-end), a diferencia de otras tareas de aprendizaje profundo. Un reciente artículo de la Universidad de Illinois y Harvard introduce "Explorative Modeling (XM)", un nuevo paradigma que resuelve este problema mediante un bucle simple (for). La idea clave es que, en cada paso de entrenamiento, el modelo genera K candidatos y solo retropropaga el gradiente a partir del candidato más cercano a los datos reales. Este enfoque evita que el modelo converja a un promedio borroso entre múltiples modos (mode blurring), un problema inherente a las funciones de pérdida de reconstrucción típicas. XM identifica una tercera dimensión escalable, además de los parámetros y los datos: la "expresividad generativa". Los experimentos en imágenes, video y lenguaje muestran que aumentar la exploración (K) mejora monótonamente el rendimiento, con ganancias de eficiencia en FLOPs, muestras y parámetros. En tareas de control robótico, una política exploratoria XM iguala o supera a políticas de difusión que requieren 100 veces más cómputo en inferencia. El trabajo sugiere que, a gran escala, la expresividad generativa se convierte en el cuello...

En 2012, AlexNet puso fin a una época con una victoria abrumadora. Antes de eso, el reconocimiento de imágenes requería diseñar manualmente un flujo de extracción de características; AlexNet demostró algo que se ha verificado repetidamente desde entonces: dejar que el modelo aprenda la tarea completa de extremo a extremo casi siempre supera a las canalizaciones en etapas diseñadas cuidadosamente por humanos.

Desde la clasificación de imágenes hasta la detección de objetos y la segmentación de imágenes, detrás de cada salto en el aprendizaje profundo está la misma frase: deja que lo aprenda todo de una vez.

Solo hay un campo que siempre ha sido la excepción: los modelos generativos.

Los modelos generativos más potentes y escalables de hoy (ya sean autorregresivos o de difusión) no son de extremo a extremo.

Durante el entrenamiento, solo aprenden a predecir "un pequeño paso", pero durante la inferencia, tienen que expandir ese paso cientos o miles de veces, como una red recurrente.

El entrenamiento y la inferencia no usan la misma estrategia de muestreo. Esta grieta trae un viejo problema: el error de cada paso se alimenta al siguiente, la entrada se aleja gradualmente de la distribución vista durante el entrenamiento, y el error se acumula capa por capa. En el ámbito académico, esto se llama "sesgo de exposición" (exposure bias).

En otras palabras, la experiencia central del aprendizaje profundo de que "extremo a extremo es mejor" no ha logrado aplicarse realmente a los modelos generativos en más de una década.

Y recientemente, un artículo de la Universidad de Illinois en Urbana-Champaign y la Universidad de Harvard intenta completar esta última pieza del rompecabezas.

Los autores le dan un nombre a este nuevo paradigma: Modelado Exploratorio (Explorative Modeling), abreviado XM. Su idea es tan simple que raya en lo ingenuo, pero apunta a una conclusión audaz: los modelos generativos, además de parámetros y datos, tienen en realidad un tercer eje que se puede ampliar.

Sitio del proyecto: https://explorative-modeling.github.io

Enlace del artículo: https://arxiv.org/abs/2607.27372

Repositorio de código: https://github.com/alexiglad/XM

La raíz del problema: el modelo solo sabe "promediar"

Para entender qué resuelve este artículo, primero hay que entender por qué la generación es difícil.

En el aprendizaje supervisado ordinario (como la clasificación), cada entrada tiene básicamente una única respuesta correcta, y al modelo le basta aprender un mapeo determinista.

Pero la generación es diferente. Le pides al modelo que "genere un perro", y las respuestas correctas pueden ser incluso infinitas. Estas salidas válidas son los distintos modos (picos independientes) de la distribución de datos. La generación es difícil precisamente porque hay que capturar todos estos modos simultáneamente.

El problema es que los modelos generativos principales se entrenan típicamente con una pérdida de reconstrucción (como el error cuadrático). Cuando a una entrada se le asignan aleatoriamente muchos objetivos válidos diferentes, la solución óptima que puede dar la pérdida de reconstrucción es el promedio de esos objetivos. Y para la gran mayoría de los datos, el promedio no está en la variedad de los datos, sino que cae entre varios modos, sin parecerse a ninguno.

La figura en el artículo es muy intuitiva: si el modelo hace regresión directamente de extremo a extremo sin ningún truco, predecirá un solo punto en el medio para tres grupos de puntos dispersos, una foto de un perro se volverá borrosa y una oración degenerará en repetir "the" una y otra vez. Esto es el "desenfoque de modos" (mode blurring), es decir, que la solución óptima es precisamente la respuesta menos parecida a los datos reales.

¿Cómo lo evitan los modelos actuales? La respuesta es descomponer el proceso de "generación". Los modelos autorregresivos predicen solo un elemento a la vez, los de difusión eliminan solo un poco de ruido a la vez, de modo que el objetivo de cada pequeño paso se reduce casi a un solo modo, y así la pérdida de reconstrucción ya no promedia.

Este "desglose del proceso generativo" es precisamente la razón por la que la difusión y los modelos autorregresivos pueden producir muestras de alta calidad, pero también es lo que impide que el modelo sea de extremo a extremo.

De esto, los autores plantean una pregunta clave: un modelo generativo solo tiene dos cosas que se pueden descomponer: cómo generar y cómo entrenar.

Dado que descomponer la generación arruina la naturaleza de extremo a extremo, ¿por qué no descomponer el entrenamiento?

Un bucle for: todo el núcleo del modelado exploratorio

Explorative Modeling descompone precisamente el ciclo de entrenamiento.

Su mecanismo se puede resumir en una oración: en cada paso de entrenamiento, el modelo ya no genera una sola muestra para forzar un objetivo, sino que genera K candidatos, y luego solo selecciona el que esté más cerca de los datos reales para entrenar y propagar el gradiente. En el artículo, lo implementan como un bucle for de 3 a 5 líneas, tan simple que resulta sospechoso (Algoritmo 1).

¿Por qué esto resuelve el desenfoque de modos?

Pongamos un ejemplo de la vida real: adivinar dónde caerán los dardos. Si solo te permiten adivinar una vez, tu estrategia óptima es adivinar la posición promedio de todos los dardos, pero ese punto a menudo es un lugar del tablero donde casi ningún dardo se ha clavado. Pero si te permiten adivinar K veces, y solo se puntúa según la más cercana, la estrategia óptima cambia inmediatamente: dispersarás estas adivinanzas, haciendo que cada una cubra un grupo diferente de puntos de impacto.

Lo mismo ocurre con el modelo. Cuando se le permite explorar K candidatos, diferentes ruidos de entrada "reclamarán" modos diferentes, en lugar de apiñarse todos en el medio para promediar. Cuantas más exploraciones, más modos puede capturar firmemente el modelo.

Los autores le dan un nombre a esta capacidad largamente ignorada: expresividad generativa (generative expressivity), y señalan que está determinada por el propio objetivo de entrenamiento, y que no aumentará por sí sola, sin importar cuánto se amplíen los parámetros y los datos.

Esto también explica un fenómeno extraño observado desde hace tiempo en la industria: ¿por qué los mejores modelos actuales dependen tanto de técnicas de "guía" (guidance)?

La llamada guía sin clasificador (classifier-free guidance) esencialmente empuja la predicción lejos de ese promedio difuso. Pero si el modelo no se difumina por sí solo, ¿para qué empujarlo? El hecho de que la guía sea útil es precisamente la raíz del problema del desenfoque de modos.

El artículo también presenta dos direcciones de exploración: Forward (hacia adelante) y Reverse (hacia atrás). La primera fija un objetivo real y busca el más cercano entre sus generaciones, sesgándose hacia el "recuerdo" (cubrir todos los modos); la segunda fija una generación y busca el más cercano en los datos reales, sesgándose hacia la "precisión", y casi no aumenta el costo computacional, a costa de poder colapsar a unos pocos modos. Ambas son complementarias y se pueden usar en combinación.

El tercer eje: cuanto más se amplía, mayores son los beneficios

La conclusión más importante de este artículo es que valida la "exploración" como un verdadero eje de escalado (scaling axis).

Los autores agregan exploración a modelos de difusión/flujo, modelos Jumpy e incluso modelos de lenguaje de difusión enmascarada, y observan consistentemente mejoras monótonas en el rendimiento en tres modalidades: imagen, video y lenguaje. Lo más crucial es la tendencia de los beneficios con la escala: cuanto más grande, más pronunciados.

Los números que da el artículo son: a medida que crece la escala de datos, la ganancia por exploración aumenta del 7% al 36%; a medida que el modelo se hace más grande, del 13% al 23%; cuando la potencia computacional se triplica, la ganancia de eficiencia más que se duplica.

En cuanto a la eficiencia específica, la exploración mejora la eficiencia de FLOP en 4.1 veces, la eficiencia de muestras en 6.2 veces y la eficiencia de parámetros en un 47%. En la generación de imágenes, lleva la receta actualmente más fuerte, RAE, a un FID de 1.43 sin guía en ImageNet, acercándose al mejor nivel de la industria.

Un modelo Large que explora 5 modos incluso puede superar a un modelo XLarge con un 47% más de parámetros pero sin exploración.

Las implicaciones de esta tendencia no son pequeñas. La explicación de los autores es: a pequeña escala, el modelo está limitado principalmente por parámetros y datos, y la expresividad generativa aún no es el cuello de botella; pero una vez que los parámetros y datos se amplían hasta el punto de que "ya no son una limitación", la expresividad generativa se convierte cada vez más en el verdadero cuello de botella. Y eso es precisamente lo que la exploración puede amplificar directamente.

Dado que el entrenamiento de los modelos base verdaderos actuales utiliza una potencia computacional aproximadamente cuatro órdenes de magnitud mayor que el mayor experimento de este artículo, los autores creen que los números reportados en el artículo probablemente sean solo el límite inferior de los beneficios a mayor escala.

Generación verdaderamente de extremo a extremo

Si se lleva la exploración al límite, ¿qué sucede? La respuesta vuelve al suspenso inicial: los modelos generativos finalmente pueden ser de extremo a extremo.

Los autores utilizan XM como un modelo independiente de extremo a extremo para tareas de control robótico. En clonación de comportamiento (Behavior Cloning), su Explorative Policy iguala o supera a Diffusion Policy (que requiere 100 pases hacia adelante) con solo un pase hacia adelante de la red; en el modelado del mundo orientado a objetivos, Explorative World Model logra un mejor rendimiento promedio que Diffuser, usando entre 16 y 256 veces menos potencia computacional de inferencia.

El origen de esta diferencia es claro: los modelos de difusión intercambian expresividad por cientos de pasos de generación durante la inferencia, mientras que XM de extremo a extremo traslada este costo a la exploración durante el entrenamiento, por lo que la inferencia requiere solo un pase hacia adelante. Para manejar "múltiples modos", la misma tarea se puede descomponer lentamente durante la inferencia o explorar completamente de una vez durante el entrenamiento; este artículo elige lo último.

Sobre los autores

El primer autor de este artículo, Alexi Gladstone, no es desconocido. En julio de 2025, su trabajo principal sobre Transformers Basados en Energía (Energy-Based Transformers, EBT) generó bastante discusión en las redes sociales.

Ese trabajo afirmaba "superar" por primera vez en múltiples dimensiones las curvas de escalado del Transformer de avance estándar, e intentaba generalizar el "pensamiento de Sistema 2" a cualquier modo. Consulte el informe de Machine Heart: "¡Llega un nuevo paradigma! Un nuevo modelo de energía rompe el límite de escalado de Transformer++, con una tasa de escalado de entrenamiento un 35% más rápida".

Explorative Modeling sigue la misma línea de pensamiento que él ha mantenido: cuestionar si "el modelo puede, a través de algún tipo de búsqueda o exploración, hacer cosas que un solo pase hacia adelante no puede". Y este artículo se basa además en otra teoría suya y de sus colaboradores (Yilun Du y Heng Ji) llamada Mode Forcing. El artículo admite que, precisamente porque esa teoría existía primero, la mayoría de los resultados de XM fueron predichos teóricamente y luego verificados experimentalmente, algo poco común en el ámbito del aprendizaje profundo, donde lo normal es "ejecutar experimentos y luego explicar".

Los autores también reconocen honestamente las limitaciones: la idea de best-of-K en sí no es nueva, otros lo han hecho muchas veces antes; su verdadera contribución es haber comprendido claramente qué hace exactamente este simple bucle: amplifica directamente la expresividad generativa sin descomponer el proceso de generación.

Además, los modelos de lenguaje autorregresivos siguen siendo el hueso más duro de roer, el XM Forward puro de extremo a extremo sigue siendo demasiado costoso en distribuciones extremadamente multimodales (como la generación de imágenes), y todo esto queda para trabajos futuros.

Durante más de una década, nos hemos acostumbrado a ajustar los modelos generativos con dos perillas: hacerlos más grandes y alimentarlos con más datos.

La tercera perilla que propone este artículo es bastante simple: dejar que el modelo adivine varias veces y quedarse solo con la mejor. Pero si la tendencia que revela es cierta, entonces, a medida que la escala continúe expandiéndose, las dos primeras perillas eventualmente llegarán a su límite, y la tercera apenas está comenzando a girar.

Enlaces de referencia

https://x.com/AlexiGlad/status/2083230922196107288

Este artículo procede del WeChat público "Machine Heart" (ID: almosthuman2014), autor: Panda

Criptos en tendencia

Preguntas relacionadas

Q¿Qué problema fundamental en los modelos generativos intenta resolver el Explorative Modeling (XM)?

AEl Explorative Modeling (XM) intenta resolver el problema del 'mode blurring' o desenfoque de modas, donde los modelos generativos entrenados con pérdidas de reconstrucción (como el error cuadrático medio) predicen la media de todas las salidas válidas posibles, que a menudo no se parece a ninguna de las muestras reales de datos.

Q¿Cuál es el mecanismo central del Explorative Modeling, descrito como un simple bucle 'for'?

AEl mecanismo central del Explorative Modeling consiste en que, en cada paso de entrenamiento, el modelo genera K candidatos en lugar de uno solo, y luego solo se selecciona y entrena con el candidato que esté más cerca de los datos reales, retropropagando el gradiente únicamente a partir de ese mejor candidato.

Q¿Qué ventaja clave ofrece el enfoque XM en comparación con modelos como los difusivos o autoregresivos en cuanto a la inferencia?

ALa ventaja clave del enfoque XM es que permite una inferencia completamente de extremo a extremo, requiriendo solo un pase hacia adelante (forward pass) de la red neuronal, en lugar de los cientos o miles de pasos iterativos necesarios en modelos difusivos o autoregresivos durante la generación.

QSegún el artículo, ¿qué es la 'expresividad generativa' (generative expressivity) y cómo la amplifica XM?

ALa 'expresividad generativa' es la capacidad inherente de un modelo generativo para capturar múltiples modas (picos independientes) en la distribución de datos. XM la amplifica directamente al permitir que el modelo explore múltiples candidatos durante el entrenamiento, asignando cada uno a una moda diferente, en lugar de colapsar todos hacia un promedio.

Q¿Qué autor principal está detrás de este trabajo y cuál fue su contribución anterior notable mencionada en el artículo?

AEl autor principal es Alexi Gladstone. Su contribución anterior notable mencionada es el desarrollo de los 'Energy-Based Transformers (EBT)', un trabajo que afirmó superar las curvas de escalamiento del Transformer estándar en múltiples dimensiones.

Lecturas Relacionadas

¿Rubin Ultra recorta especificaciones? ¿Ni siquiera NVIDIA puede soportar el aumento del precio de la memoria?

El informe de SemiAnalysis ha desencadenado un intenso debate en la industria de la IA al revelar posibles ajustes importantes en las especificaciones de Rubin Ultra, la próxima GPU flagship de NVIDIA para IA. Según el informe, Rubin Ultra mantendría el mismo pico teórico de potencia computacional (35 PFLOPs) que Rubin, pero sufriría una reducción significativa en la memoria: se especificaría con 192GB HBM apilado en 8 capas (8-Hi), incluso menos que los 288GB (12-Hi) de Rubin. El ancho de banda de memoria solo aumentaría ligeramente (1 TB/s), y el consumo energético sería similar o ligeramente superior. La mejora principal se centraría en la capacidad de interconexión a escala, soportando clusters de hasta 576 GPUs unidas mediante NVLink (frente a 72 en Rubin), creando un "super-GPU lógico". La causa principal de esta revisión sería el rápido aumento del precio de la memoria HBM, cuyo costo se habría triplicado desde 2025, impactando fuertemente el costo total de los sistemas. Al reducir la cantidad de HBM (bajando su participación en el costo del ~40% al ~28%) e invertir más en la interconexión (subiendo del 4% al 12%), NVIDIA optimizaría la relación costo-rendimiento del sistema completo. Esta noticia provocó una caída de aproximadamente el 8% en las acciones de los principales fabricantes de HBM, SK Hynix y Samsung, reflejando la preocupación del mercado sobre un posible punto de inflexión en la demanda de memoria de alta gama por parte del mayor comprador, NVIDIA, y el fin de una era de expansión sin restricciones en la infraestructura de IA.

Odaily星球日报Hace 6 min(s)

¿Rubin Ultra recorta especificaciones? ¿Ni siquiera NVIDIA puede soportar el aumento del precio de la memoria?

Odaily星球日报Hace 6 min(s)

¿Máximo de 20 artículos por persona? La nueva norma de ICLR recibe una «petición» sarcástica de un investigador de DeepMind

Un investigador de DeepMind satiriza la nueva norma de ICLR que limita a 20 artículos por autor. La conferencia de IA ICLR 2027 ha establecido una nueva regla: cada autor solo puede figurar en un máximo de 20 trabajos enviados. Los que excedan este límite serán advertidos y, de no corregirse, algunos serán rechazados aleatoriamente. La justificación es la enorme presión sobre el sistema de revisión, tras un aumento del 68% en los envíos para ICLR 2026 (19,525 trabajos). Dan Roy, investigador de Google DeepMind, respondió con una "petición" irónica en X, pidiendo que se elimine el límite. Su mensaje, cargado de sarcasmo, sugiere que los agentes de IA ahora pueden producir investigaciones incrementales y que, "dado que todo el trabajo de revisión ya lo hacen los grandes modelos de lenguaje", debería animarse a enviar más trabajos, no menos. Su sátira apunta a un problema real: el uso de IA tanto en la autoría como en la revisión. Un análisis de 2025 detectó que aproximadamente el 21% de las revisiones de ICLR 2026 eran probablemente generadas completamente por IA. La broma de Roy plantea una pregunta seria: en un entorno donde agentes generan artículos, autores los envían en masa y revisores potencialmente usan IA, ¿limitar el número de envíos es la solución adecuada? El debate sobre la calidad versus la cantidad, y el papel de la IA en la academia, continúa.

marsbitHace 1 hora(s)

¿Máximo de 20 artículos por persona? La nueva norma de ICLR recibe una «petición» sarcástica de un investigador de DeepMind

marsbitHace 1 hora(s)

Trading

Spot

Artículos destacados

Cómo comprar CORE

¡Bienvenido a HTX.com! Hemos hecho que comprar CORE (CORE) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar CORE (CORE) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu CORE (CORE)Después de comprar tu CORE (CORE), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear CORE (CORE)Tradear fácilmente con CORE (CORE) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

442 Vistas totalesPublicado en 2024.12.13Actualizado en 2026.06.02

Cómo comprar CORE

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de CORE (CORE).

活动图片