¿Los modelos generativos también pueden entrenarse de extremo a extremo? El núcleo es un bucle for

marsbitОпубликовано 2026-08-03Обновлено 2026-08-03

Введение

El entrenamiento de modelos generativos siempre ha sido un reto debido a la "desviación por exposición" (exposure bias): durante el entrenamiento solo se aprenden pequeños pasos, mientras que la generación requiere cientos de iteraciones, lo que causa acumulación de errores. Esto ha impedido que los modelos generativos sean entrenados de extremo a extremo (end-to-end), a diferencia de otras tareas de aprendizaje profundo. Un reciente artículo de la Universidad de Illinois y Harvard introduce "Explorative Modeling (XM)", un nuevo paradigma que resuelve este problema mediante un bucle simple (for). La idea clave es que, en cada paso de entrenamiento, el modelo genera K candidatos y solo retropropaga el gradiente a partir del candidato más cercano a los datos reales. Este enfoque evita que el modelo converja a un promedio borroso entre múltiples modos (mode blurring), un problema inherente a las funciones de pérdida de reconstrucción típicas. XM identifica una tercera dimensión escalable, además de los parámetros y los datos: la "expresividad generativa". Los experimentos en imágenes, video y lenguaje muestran que aumentar la exploración (K) mejora monótonamente el rendimiento, con ganancias de eficiencia en FLOPs, muestras y parámetros. En tareas de control robótico, una política exploratoria XM iguala o supera a políticas de difusión que requieren 100 veces más cómputo en inferencia. El trabajo sugiere que, a gran escala, la expresividad generativa se convierte en el cuello...

En 2012, AlexNet puso fin a una época con una victoria abrumadora. Antes de eso, el reconocimiento de imágenes requería diseñar manualmente un flujo de extracción de características; AlexNet demostró algo que se ha verificado repetidamente desde entonces: dejar que el modelo aprenda la tarea completa de extremo a extremo casi siempre supera a las canalizaciones en etapas diseñadas cuidadosamente por humanos.

Desde la clasificación de imágenes hasta la detección de objetos y la segmentación de imágenes, detrás de cada salto en el aprendizaje profundo está la misma frase: deja que lo aprenda todo de una vez.

Solo hay un campo que siempre ha sido la excepción: los modelos generativos.

Los modelos generativos más potentes y escalables de hoy (ya sean autorregresivos o de difusión) no son de extremo a extremo.

Durante el entrenamiento, solo aprenden a predecir "un pequeño paso", pero durante la inferencia, tienen que expandir ese paso cientos o miles de veces, como una red recurrente.

El entrenamiento y la inferencia no usan la misma estrategia de muestreo. Esta grieta trae un viejo problema: el error de cada paso se alimenta al siguiente, la entrada se aleja gradualmente de la distribución vista durante el entrenamiento, y el error se acumula capa por capa. En el ámbito académico, esto se llama "sesgo de exposición" (exposure bias).

En otras palabras, la experiencia central del aprendizaje profundo de que "extremo a extremo es mejor" no ha logrado aplicarse realmente a los modelos generativos en más de una década.

Y recientemente, un artículo de la Universidad de Illinois en Urbana-Champaign y la Universidad de Harvard intenta completar esta última pieza del rompecabezas.

Los autores le dan un nombre a este nuevo paradigma: Modelado Exploratorio (Explorative Modeling), abreviado XM. Su idea es tan simple que raya en lo ingenuo, pero apunta a una conclusión audaz: los modelos generativos, además de parámetros y datos, tienen en realidad un tercer eje que se puede ampliar.

Sitio del proyecto: https://explorative-modeling.github.io

Enlace del artículo: https://arxiv.org/abs/2607.27372

Repositorio de código: https://github.com/alexiglad/XM

La raíz del problema: el modelo solo sabe "promediar"

Para entender qué resuelve este artículo, primero hay que entender por qué la generación es difícil.

En el aprendizaje supervisado ordinario (como la clasificación), cada entrada tiene básicamente una única respuesta correcta, y al modelo le basta aprender un mapeo determinista.

Pero la generación es diferente. Le pides al modelo que "genere un perro", y las respuestas correctas pueden ser incluso infinitas. Estas salidas válidas son los distintos modos (picos independientes) de la distribución de datos. La generación es difícil precisamente porque hay que capturar todos estos modos simultáneamente.

El problema es que los modelos generativos principales se entrenan típicamente con una pérdida de reconstrucción (como el error cuadrático). Cuando a una entrada se le asignan aleatoriamente muchos objetivos válidos diferentes, la solución óptima que puede dar la pérdida de reconstrucción es el promedio de esos objetivos. Y para la gran mayoría de los datos, el promedio no está en la variedad de los datos, sino que cae entre varios modos, sin parecerse a ninguno.

La figura en el artículo es muy intuitiva: si el modelo hace regresión directamente de extremo a extremo sin ningún truco, predecirá un solo punto en el medio para tres grupos de puntos dispersos, una foto de un perro se volverá borrosa y una oración degenerará en repetir "the" una y otra vez. Esto es el "desenfoque de modos" (mode blurring), es decir, que la solución óptima es precisamente la respuesta menos parecida a los datos reales.

¿Cómo lo evitan los modelos actuales? La respuesta es descomponer el proceso de "generación". Los modelos autorregresivos predicen solo un elemento a la vez, los de difusión eliminan solo un poco de ruido a la vez, de modo que el objetivo de cada pequeño paso se reduce casi a un solo modo, y así la pérdida de reconstrucción ya no promedia.

Este "desglose del proceso generativo" es precisamente la razón por la que la difusión y los modelos autorregresivos pueden producir muestras de alta calidad, pero también es lo que impide que el modelo sea de extremo a extremo.

De esto, los autores plantean una pregunta clave: un modelo generativo solo tiene dos cosas que se pueden descomponer: cómo generar y cómo entrenar.

Dado que descomponer la generación arruina la naturaleza de extremo a extremo, ¿por qué no descomponer el entrenamiento?

Un bucle for: todo el núcleo del modelado exploratorio

Explorative Modeling descompone precisamente el ciclo de entrenamiento.

Su mecanismo se puede resumir en una oración: en cada paso de entrenamiento, el modelo ya no genera una sola muestra para forzar un objetivo, sino que genera K candidatos, y luego solo selecciona el que esté más cerca de los datos reales para entrenar y propagar el gradiente. En el artículo, lo implementan como un bucle for de 3 a 5 líneas, tan simple que resulta sospechoso (Algoritmo 1).

¿Por qué esto resuelve el desenfoque de modos?

Pongamos un ejemplo de la vida real: adivinar dónde caerán los dardos. Si solo te permiten adivinar una vez, tu estrategia óptima es adivinar la posición promedio de todos los dardos, pero ese punto a menudo es un lugar del tablero donde casi ningún dardo se ha clavado. Pero si te permiten adivinar K veces, y solo se puntúa según la más cercana, la estrategia óptima cambia inmediatamente: dispersarás estas adivinanzas, haciendo que cada una cubra un grupo diferente de puntos de impacto.

Lo mismo ocurre con el modelo. Cuando se le permite explorar K candidatos, diferentes ruidos de entrada "reclamarán" modos diferentes, en lugar de apiñarse todos en el medio para promediar. Cuantas más exploraciones, más modos puede capturar firmemente el modelo.

Los autores le dan un nombre a esta capacidad largamente ignorada: expresividad generativa (generative expressivity), y señalan que está determinada por el propio objetivo de entrenamiento, y que no aumentará por sí sola, sin importar cuánto se amplíen los parámetros y los datos.

Esto también explica un fenómeno extraño observado desde hace tiempo en la industria: ¿por qué los mejores modelos actuales dependen tanto de técnicas de "guía" (guidance)?

La llamada guía sin clasificador (classifier-free guidance) esencialmente empuja la predicción lejos de ese promedio difuso. Pero si el modelo no se difumina por sí solo, ¿para qué empujarlo? El hecho de que la guía sea útil es precisamente la raíz del problema del desenfoque de modos.

El artículo también presenta dos direcciones de exploración: Forward (hacia adelante) y Reverse (hacia atrás). La primera fija un objetivo real y busca el más cercano entre sus generaciones, sesgándose hacia el "recuerdo" (cubrir todos los modos); la segunda fija una generación y busca el más cercano en los datos reales, sesgándose hacia la "precisión", y casi no aumenta el costo computacional, a costa de poder colapsar a unos pocos modos. Ambas son complementarias y se pueden usar en combinación.

El tercer eje: cuanto más se amplía, mayores son los beneficios

La conclusión más importante de este artículo es que valida la "exploración" como un verdadero eje de escalado (scaling axis).

Los autores agregan exploración a modelos de difusión/flujo, modelos Jumpy e incluso modelos de lenguaje de difusión enmascarada, y observan consistentemente mejoras monótonas en el rendimiento en tres modalidades: imagen, video y lenguaje. Lo más crucial es la tendencia de los beneficios con la escala: cuanto más grande, más pronunciados.

Los números que da el artículo son: a medida que crece la escala de datos, la ganancia por exploración aumenta del 7% al 36%; a medida que el modelo se hace más grande, del 13% al 23%; cuando la potencia computacional se triplica, la ganancia de eficiencia más que se duplica.

En cuanto a la eficiencia específica, la exploración mejora la eficiencia de FLOP en 4.1 veces, la eficiencia de muestras en 6.2 veces y la eficiencia de parámetros en un 47%. En la generación de imágenes, lleva la receta actualmente más fuerte, RAE, a un FID de 1.43 sin guía en ImageNet, acercándose al mejor nivel de la industria.

Un modelo Large que explora 5 modos incluso puede superar a un modelo XLarge con un 47% más de parámetros pero sin exploración.

Las implicaciones de esta tendencia no son pequeñas. La explicación de los autores es: a pequeña escala, el modelo está limitado principalmente por parámetros y datos, y la expresividad generativa aún no es el cuello de botella; pero una vez que los parámetros y datos se amplían hasta el punto de que "ya no son una limitación", la expresividad generativa se convierte cada vez más en el verdadero cuello de botella. Y eso es precisamente lo que la exploración puede amplificar directamente.

Dado que el entrenamiento de los modelos base verdaderos actuales utiliza una potencia computacional aproximadamente cuatro órdenes de magnitud mayor que el mayor experimento de este artículo, los autores creen que los números reportados en el artículo probablemente sean solo el límite inferior de los beneficios a mayor escala.

Generación verdaderamente de extremo a extremo

Si se lleva la exploración al límite, ¿qué sucede? La respuesta vuelve al suspenso inicial: los modelos generativos finalmente pueden ser de extremo a extremo.

Los autores utilizan XM como un modelo independiente de extremo a extremo para tareas de control robótico. En clonación de comportamiento (Behavior Cloning), su Explorative Policy iguala o supera a Diffusion Policy (que requiere 100 pases hacia adelante) con solo un pase hacia adelante de la red; en el modelado del mundo orientado a objetivos, Explorative World Model logra un mejor rendimiento promedio que Diffuser, usando entre 16 y 256 veces menos potencia computacional de inferencia.

El origen de esta diferencia es claro: los modelos de difusión intercambian expresividad por cientos de pasos de generación durante la inferencia, mientras que XM de extremo a extremo traslada este costo a la exploración durante el entrenamiento, por lo que la inferencia requiere solo un pase hacia adelante. Para manejar "múltiples modos", la misma tarea se puede descomponer lentamente durante la inferencia o explorar completamente de una vez durante el entrenamiento; este artículo elige lo último.

Sobre los autores

El primer autor de este artículo, Alexi Gladstone, no es desconocido. En julio de 2025, su trabajo principal sobre Transformers Basados en Energía (Energy-Based Transformers, EBT) generó bastante discusión en las redes sociales.

Ese trabajo afirmaba "superar" por primera vez en múltiples dimensiones las curvas de escalado del Transformer de avance estándar, e intentaba generalizar el "pensamiento de Sistema 2" a cualquier modo. Consulte el informe de Machine Heart: "¡Llega un nuevo paradigma! Un nuevo modelo de energía rompe el límite de escalado de Transformer++, con una tasa de escalado de entrenamiento un 35% más rápida".

Explorative Modeling sigue la misma línea de pensamiento que él ha mantenido: cuestionar si "el modelo puede, a través de algún tipo de búsqueda o exploración, hacer cosas que un solo pase hacia adelante no puede". Y este artículo se basa además en otra teoría suya y de sus colaboradores (Yilun Du y Heng Ji) llamada Mode Forcing. El artículo admite que, precisamente porque esa teoría existía primero, la mayoría de los resultados de XM fueron predichos teóricamente y luego verificados experimentalmente, algo poco común en el ámbito del aprendizaje profundo, donde lo normal es "ejecutar experimentos y luego explicar".

Los autores también reconocen honestamente las limitaciones: la idea de best-of-K en sí no es nueva, otros lo han hecho muchas veces antes; su verdadera contribución es haber comprendido claramente qué hace exactamente este simple bucle: amplifica directamente la expresividad generativa sin descomponer el proceso de generación.

Además, los modelos de lenguaje autorregresivos siguen siendo el hueso más duro de roer, el XM Forward puro de extremo a extremo sigue siendo demasiado costoso en distribuciones extremadamente multimodales (como la generación de imágenes), y todo esto queda para trabajos futuros.

Durante más de una década, nos hemos acostumbrado a ajustar los modelos generativos con dos perillas: hacerlos más grandes y alimentarlos con más datos.

La tercera perilla que propone este artículo es bastante simple: dejar que el modelo adivine varias veces y quedarse solo con la mejor. Pero si la tendencia que revela es cierta, entonces, a medida que la escala continúe expandiéndose, las dos primeras perillas eventualmente llegarán a su límite, y la tercera apenas está comenzando a girar.

Enlaces de referencia

https://x.com/AlexiGlad/status/2083230922196107288

Este artículo procede del WeChat público "Machine Heart" (ID: almosthuman2014), autor: Panda

Трендовые криптовалюты

Связанные с этим вопросы

Q¿Qué problema fundamental en los modelos generativos intenta resolver el Explorative Modeling (XM)?

AEl Explorative Modeling (XM) intenta resolver el problema del 'mode blurring' o desenfoque de modas, donde los modelos generativos entrenados con pérdidas de reconstrucción (como el error cuadrático medio) predicen la media de todas las salidas válidas posibles, que a menudo no se parece a ninguna de las muestras reales de datos.

Q¿Cuál es el mecanismo central del Explorative Modeling, descrito como un simple bucle 'for'?

AEl mecanismo central del Explorative Modeling consiste en que, en cada paso de entrenamiento, el modelo genera K candidatos en lugar de uno solo, y luego solo se selecciona y entrena con el candidato que esté más cerca de los datos reales, retropropagando el gradiente únicamente a partir de ese mejor candidato.

Q¿Qué ventaja clave ofrece el enfoque XM en comparación con modelos como los difusivos o autoregresivos en cuanto a la inferencia?

ALa ventaja clave del enfoque XM es que permite una inferencia completamente de extremo a extremo, requiriendo solo un pase hacia adelante (forward pass) de la red neuronal, en lugar de los cientos o miles de pasos iterativos necesarios en modelos difusivos o autoregresivos durante la generación.

QSegún el artículo, ¿qué es la 'expresividad generativa' (generative expressivity) y cómo la amplifica XM?

ALa 'expresividad generativa' es la capacidad inherente de un modelo generativo para capturar múltiples modas (picos independientes) en la distribución de datos. XM la amplifica directamente al permitir que el modelo explore múltiples candidatos durante el entrenamiento, asignando cada uno a una moda diferente, en lugar de colapsar todos hacia un promedio.

Q¿Qué autor principal está detrás de este trabajo y cuál fue su contribución anterior notable mencionada en el artículo?

AEl autor principal es Alexi Gladstone. Su contribución anterior notable mencionada es el desarrollo de los 'Energy-Based Transformers (EBT)', un trabajo que afirmó superar las curvas de escalamiento del Transformer estándar en múltiples dimensiones.

Похожее

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

Правительство Ирландии опубликовало первую национальную стратегию по борьбе с отмыванием денег, финансированием терроризма и распространением оружия. Документ включает меры по регулированию криптоактивов для противодействия их использованию в незаконных целях. Стратегия предполагает введение новых обязательств для поставщиков услуг с криптоактивами, усиление проверок транзакций с частными кошельками и более строгую проверку зарубежных криптокомпаний. Ирландия планирует внедрить эти отраслевые стандарты, соответствующие европейскому регламенту MiCA, во второй половине 2027 года. Стратегия также затрагивает вопросы использования криптоактивов в качестве источника средств для азартных игр.

cointelegraph48 мин. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

cointelegraph48 мин. назад

Grayscale: «Если предложения будут приняты, цены на эти два альткоина могут вырасти»

Глава исследовательского отдела Grayscale Зак Пандл заявил, что обсуждаемые в сообществах Ethereum ($ETH) и Solana ($SOL) изменения в токеномике, направленные на снижение инфляции предложения, могут замедлить рост выпуска новых монет. Это потенциально создаст дефицит и окажет повышательное давление на цены. По оценкам Grayscale, в случае реализации изменений годовая инфляция предложения ETH может снизиться до ~0.4% к концу 2031 года (близко к показателям Bitcoin), а для SOL — до ~1.1%. Для сравнения, ежегодный прирост предложения золота составляет ~1.8%. Пандл отмечает, что предложения по Solana, по-видимому, имеют больше шансов на реализацию. Однако снижение инфляции может также уменьшить вознаграждения для стейкеров, так как значительная часть их дохода формируется за счет эмиссии новых токенов. Выгоду от возможного роста цен в первую очередь получат инвесторы, владеющие токенами без стейкинга. Предложения пока не утверждены окончательно.

cryptonews.ru1 ч. назад

Grayscale: «Если предложения будут приняты, цены на эти два альткоина могут вырасти»

cryptonews.ru1 ч. назад

Эксперты назвали причины падения биткоина после снижения инфляции в США

Благоприятные данные по инфляции в США в июле, соответствовавшие или превзошедшие ожидания, не привели к росту биткоина. Эксперты CryptoQuant видят основную причину в слабом спотовом спросе. Приток в американские биткоин-ETF остаётся низким, а индекс Coinbase Premium, указывающий на активность инвесторов из США, сохраняется в отрицательной зоне. Это свидетельствует об ограниченном покупательном давлении. При этом позиции на фьючерсном рынке остаются высокими, создавая дисбаланс: слабая ликвидность и спрос при значительном объёме маржинальных позиций. В таких условиях даже позитивные макроновости могут не спровоцировать рост, а скорее привести к закрытию лонгов и дальнейшему давлению на цену. Ключевым уровнем сопротивления названа отметка около $68 700. Для возобновления устойчивого роста рынку, по мнению аналитиков, необходим возобновлённый приток в ETF, рост спотовых объёмов, переход Coinbase Premium в плюс и уверенное закрепление биткоина выше $68 700.

cryptonews.ru2 ч. назад

Эксперты назвали причины падения биткоина после снижения инфляции в США

cryptonews.ru2 ч. назад

Курс биткоина опустился до 62 470 долларов, поскольку продавцы вновь тестируют уровень поддержки в 63 000 долларов

Курс биткоина в пятницу продолжил снижение, вновь опустившись ниже уровня поддержки в 63 000 долларов и достигнув дневного минимума в 62 470 долларов. Несмотря на последующее восстановление до отметки около 63 000 долларов, динамика цены оставалась вялой, а рыночная капитализация удерживалась ниже 1,27 трлн долларов. На рынке усилилась волатильность, приведя к значительным ликвидациям длинных позиций с кредитным плечом. Дополнительное давление оказал устойчивый отток средств из спотовых биткоин-ETF, что говорит о возможном отступлении институциональных инвесторов. Ситуацию усугубило предложение провайдера индексов MSCI о новых критериях отбора, которые могут привести к исключению из индексов компаний, активно использующих биткоин в казначейских резервах, таких как Strategy и Metaplanet. Это потенциально спровоцирует их принудительную распродажу институциональными фондами. Strategy публично осудила данную инициативу, заявив, что поставщики индексов должны измерять рынки, а не диктовать компаниям, какими активами владеть. Окончательное решение MSCI ожидается в октябре, и в случае принятия новые правила могут начать действовать уже в ноябре, создавая дополнительные препятствия для роста биткоина в конце года.

cryptonews.ru2 ч. назад

Курс биткоина опустился до 62 470 долларов, поскольку продавцы вновь тестируют уровень поддержки в 63 000 долларов

cryptonews.ru2 ч. назад

Торговля

Спот

Популярные статьи

Как купить CORE

Добро пожаловать на HTX.com! Мы сделали приобретение CORE (CORE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки CORE (CORE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение CORE (CORE)После приобретения вами CORE (CORE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля CORE (CORE)С легкостью торгуйте CORE (CORE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

769 просмотров всегоОпубликовано 2024.03.29Обновлено 2026.06.02

Как купить CORE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на CORE (CORE) представлены ниже.

活动图片