Les modèles génératifs peuvent aussi être entraînés de bout en bout ? Le noyau est en fait une boucle for

marsbitОпубліковано о 2026-08-03Востаннє оновлено о 2026-08-03

Анотація

En 2012, AlexNet a révolutionné l'apprentissage profond en introduisant l'entraînement de bout en bout, où le modèle apprend une tâche complète en une seule fois, surpassant les approches par étapes conçues par l'homme. Cependant, les modèles génératifs actuels, comme les modèles autorégressifs ou de diffusion, font exception : ils sont entraînés à prédire une seule petite étape, puis doivent dérouler cette étape des centaines de fois lors de l'inférence. Cet écart entre l'entraînement et l'inférence entraîne un biais d'exposition (exposure bias), où les erreurs s'accumulent. Un récent article de l'Université de l'Illinois et de Harvard propose un nouveau paradigme, appelé Modélisation Exploratoire (Explorative Modeling, ou XM), pour résoudre ce problème. L'idée centrale est simple : au lieu de générer un seul échantillon par étape d'entraînement, le modèle en génère K, puis ne garde que le plus proche des données réelles pour calculer la perte et mettre à jour les paramètres. Cette boucle d'exploration, implémentée en quelques lignes de code, permet au modèle de capturer plusieurs modes de la distribution de données, évitant ainsi le flou modal (mode blurring) où le modèle converge vers une moyenne peu réaliste. Les auteurs démontrent que cette "expressivité générative" agit comme un troisième axe d'optimisation, indépendant de la taille du modèle ou des données. Les résultats montrent des gains croissants avec l'échelle : l'exploration améliore l'efficacité des FLOPs d'un...

En 2012, AlexNet a mis fin à une ère par une victoire écrasante. Avant cela, la reconnaissance d'images nécessitait une conception manuelle, étape par étape, de l'extraction des caractéristiques ; AlexNet a prouvé quelque chose qui a été maintes fois vérifié depuis : confier l'intégralité de la tâche de façon end-to-end au modèle pour qu'il apprenne par lui-même bat presque toujours les pipelines en plusieurs étapes soigneusement conçus par l'homme.

De la classification d'images à la détection d'objets en passant par la segmentation, derrière chaque bond en avant du deep learning, on retrouve la même maxime : laissons-le tout apprendre d'un seul coup.

Un seul domaine est resté une exception : les modèles génératifs.

Aujourd'hui, les modèles génératifs les plus puissants et les plus extensibles (qu'ils soient autorégressifs ou par diffusion) ne sont pas end-to-end.

À l'entraînement, ils n'apprennent qu'à prédire un « petit pas », mais à l'inférence, il faut dérouler ce pas des centaines, voire des milliers de fois, comme un réseau récurrent.

L'entraînement et l'inférence n'utilisent pas le même schéma d'échantillonnage. Cette fissure engendre un vieux problème : l'erreur de chaque étape est transmise à la suivante, l'entrée dérive progressivement de la distribution observée pendant l'entraînement, et les erreurs s'accumulent. On appelle cela académiquement le biais d'exposition (exposure bias).

En d'autres termes, cette expérience centrale du deep learning, « end-to-end est meilleur », n'a jamais vraiment été appliquée aux modèles génératifs au cours des quinze dernières années.

Et tout récemment, un article de l'UIUC et de l'Université Harvard tente de compléter cette dernière pièce du puzzle.

Les auteurs ont donné à ce nouveau paradigme le nom de Modélisation Exploratoire (Explorative Modeling), abrégé XM. Son idée est simple, voire naïve, mais pointe vers une conclusion audacieuse : les modèles génératifs, en plus des paramètres et des données, ont en réalité un troisième axe sur lequel on peut jouer.

Site du projet : https://explorative-modeling.github.io

Lien de l'article : https://arxiv.org/abs/2607.27372

Dépôt de code : https://github.com/alexiglad/XM

La racine du problème : le modèle ne sait que « faire la moyenne »

Pour comprendre ce que cet article cherche à résoudre, il faut d'abord comprendre ce qui rend la génération difficile.

L'apprentissage supervisé classique (comme la classification) a généralement une seule bonne réponse par entrée, il suffit donc que le modèle apprenne un mapping déterminé.

Mais la génération est différente. Demandez au modèle de « générer un chien », et les bonnes réponses peuvent même être infinies. Ces sorties légitimes sont les différents modes de la distribution de données (c'est-à-dire les pics indépendants dans la distribution). La génération est difficile précisément parce qu'il faut capter simultanément tous ces modes.

Le problème est que les modèles génératifs dominants utilisent une perte de reconstruction (comme l'erreur quadratique) à l'entraînement. Lorsqu'une entrée est associée de manière aléatoire à plusieurs cibles légitimes différentes, la solution optimale que peut donner une perte de reconstruction est la moyenne de ces cibles. Et pour la grande majorité des données, cette moyenne ne se trouve pas sur la variété des données, mais entre les modes, ne ressemblant à aucun d'eux.

L'illustration dans l'article est intuitive : si l'on demande à un modèle de faire une régression directe end-to-end sans aucune astuce, trois nuages de points seront prédits comme un point central unique, une photo de chien sera floue, une phrase dégénérera en une répétition infinie de « the ». C'est le flou des modes (mode blurring), où la solution optimale est justement la réponse qui ressemble le moins aux données réelles.

Comment les modèles existants contournent-ils cela ? La réponse est de décomposer l'acte de « génération ». L'autorégression ne prédit qu'un seul élément à la fois, la diffusion n'enlève qu'un peu de bruit à la fois, chaque petit pas voit sa cible réduite à presque un seul mode, de sorte que la perte de reconstruction n'a plus à faire de moyenne.

Ce principe de « décomposition du processus de génération » est précisément ce qui permet aux modèles de diffusion et autorégressifs de produire des échantillons de haute qualité, mais c'est aussi ce qui les empêche d'être end-to-end.

Les auteurs posent alors une question cruciale : un modèle génératif n'a que deux choses à décomposer : comment générer, et comment s'entraîner.

Puisque décomposer la génération détruit l'approche end-to-end, pourquoi ne pas décomposer l'entraînement ?

Une boucle for : tout le noyau de la modélisation exploratoire

La Modélisation Exploratoire décompose la boucle d'entraînement elle-même.

Son mécanisme peut se résumer en une phrase : à chaque étape d'entraînement, le modèle ne génère plus un seul échantillon pour s'approcher de la cible, mais génère K candidats, puis ne sélectionne que celui qui est le plus proche des données réelles pour l'entraînement et la rétropropagation du gradient. Dans l'article, cela est implémenté sous forme d'une boucle for de 3 à 5 lignes, d'une simplicité qui laisse presque perplexe (Algorithme 1).

Pourquoi cela résout-il le flou des modes ?

Imaginons une autre situation de la vie quotidienne : deviner où une fléchette va atterrir. Si vous ne pouvez faire qu'une seule prédiction, votre stratégie optimale est de deviner la position moyenne de toutes les fléchettes, mais c'est souvent un endroit du tableau où aucune ou très peu de fléchettes ne se sont plantées. En revanche, si vous avez le droit de faire K prédictions et que seule la plus proche compte, la stratégie optimale change immédiatement : vous allez disperser ces prédictions pour que chacune couvre un groupe différent de points d'impact.

Il en va de même pour le modèle. Lorsqu'on lui permet d'explorer K candidats, les différentes entrées de bruit vont chacune « s'approprier » un mode différent, au lieu de se précipiter toutes vers le centre pour faire la moyenne. Le nombre d'explorations détermine combien de modes le modèle peut capturer de manière stable.

Les auteurs donnent un nom à cette capacité longtemps négligée : l'expressivité générative (generative expressivity), et soulignent qu'elle est déterminée par l'objectif d'entraînement lui-même ; peu importe l'augmentation des paramètres ou des données, elle n'augmentera pas d'elle-même.

Cela explique aussi un phénomène étrange observé depuis longtemps dans le domaine : pourquoi les meilleurs modèles d'aujourd'hui dépendent-ils autant des techniques de « guidage » (guidance) ?

Le guidage sans classificateur consiste essentiellement à « éloigner » la prédiction de cette moyenne floue. Mais si le modèle n'est pas flou lui-même, pourquoi le pousser ? L'utilité du guidage provient précisément de la racine du problème qu'est le flou des modes.

L'article présente aussi deux directions d'exploration : Forward et Reverse. La première fixe une cible réelle et recherche parmi ses propres générations celle qui est la plus proche, favorisant le « rappel » (couverture de tous les modes). La seconde fixe une génération et recherche dans les données réelles la plus proche, favorisant la « précision », avec presque aucun coût de calcul supplémentaire, mais au risque de s'effondrer sur quelques modes seulement. Ces deux approches sont complémentaires et peuvent être combinées.

Le troisième axe : plus on l'amplifie, plus les bénéfices sont grands

La conclusion la plus significative de cet article est qu'il vérifie que l'« exploration » est un véritable axe d'échelle (scaling axis).

Les auteurs ajoutent l'exploration à des modèles de diffusion/flux, des modèles Jumpy et même des modèles de langage par diffusion masquée, et observent une amélioration monotone des performances sur trois modalités : image, vidéo et langage. Plus crucial encore, la tendance des bénéfices en fonction de l'échelle : plus on augmente la taille, plus l'amélioration est marquée.

Les chiffres donnés dans l'article sont les suivants : à mesure que la taille des données augmente, le gain apporté par l'exploration passe de 7 % à 36 % ; à mesure que le modèle grandit, il passe de 13 % à 23 % ; lorsque la puissance de calcul triple, le gain d'efficacité plus que double.

En termes d'efficacité, l'exploration améliore l'efficacité en FLOPs par un facteur de 4,1, l'efficacité en échantillons par un facteur de 6,2 et l'efficacité en paramètres de 47 %. Pour la génération d'images, elle pousse la recette RAE actuellement la plus puissante à un FID de 1,43 sans guidage sur ImageNet, approchant les meilleurs niveaux du domaine.

Un grand modèle explorant 5 modes peut même surpasser un très grand modèle avec 47 % de paramètres supplémentaires mais sans exploration.

Cette tendance n'est pas anodine. L'explication des auteurs est la suivante : à petite échelle, le modèle est principalement limité par les paramètres et les données, l'expressivité générative n'étant pas encore le goulot d'étranglement ; mais une fois que les paramètres et les données sont suffisamment grands pour ne plus être une limite, l'expressivité générative devient de plus en plus le véritable goulot d'étranglement. Et c'est précisément ce que l'exploration peut amplifier directement.

Considérant que l'entraînement des vrais modèles de base d'aujourd'hui utilise une puissance de calcul environ 10 000 fois supérieure à celle de la plus grande expérience de cet article, les auteurs pensent que les chiffres rapportés dans l'article ne sont probablement que la limite inférieure des bénéfices à plus grande échelle.

La génération véritablement end-to-end

Si l'on pousse l'exploration à l'extrême, que se passe-t-il ? La réponse ramène à la question initiale : les modèles génératifs peuvent enfin être end-to-end.

Les auteurs utilisent XM comme un modèle indépendant end-to-end pour des tâches de contrôle robotique. En imitation comportementale (Behavior Cloning), leur politique exploratoire (Explorative Policy) n'utilise qu'une seule passe avant du réseau pour égaler, voire surpasser, la politique par diffusion (Diffusion Policy) qui nécessite 100 passes avant ; en modélisation du monde orientée vers un but (goal-conditioned world modeling), le modèle exploratoire du monde (Explorative World Model) utilise de 16 à 256 fois moins de calculs d'inférence que le Diffuser, tout en obtenant de meilleures performances moyennes.

La source de cet écart est claire : les modèles de diffusion utilisent des centaines d'étapes de génération à l'inférence pour obtenir de l'expressivité, tandis que le XM end-to-end déplace ce coût vers l'exploration à l'entraînement, l'inférence ne nécessitant ainsi qu'une seule passe avant. La même tâche de « gérer plusieurs modes » peut être décomposée lentement à l'inférence, ou explorée en une fois pendant l'entraînement ; cet article choisit la seconde option.

Présentation des auteurs

Le premier auteur de cet article, Alexi Gladstone, n'est pas inconnu. En juillet 2025, ses Transformateurs à Base d'Énergie (Energy-Based Transformers, EBT) avaient déjà suscité de nombreuses discussions sur les réseaux sociaux.

Ce travail prétendait pour la première fois « surpasser » la courbe d'échelle du Transformer à propagation avant standard sur plusieurs dimensions, et cherchait à étendre la « pensée de type System 2 » à un mode arbitraire. Voir l'article de Machine Heart : « Un nouveau paradigme arrive ! Le nouveau modèle énergétique brise les limites d'extension de Transformer++, taux d'extension à l'entraînement 35% plus rapide ».

La Modélisation Exploratoire s'inscrit dans la continuité de sa démarche constante : questionner si « un modèle peut, par une certaine forme de recherche, d'exploration, accomplir ce qu'une seule passe avant ne peut pas faire ». Cet article s'appuie également sur une autre théorie développée avec ses collaborateurs (Yilun Du et Heng Ji) : Mode Forcing. L'article admet que, précisément parce que cette théorie existait au préalable, la plupart des résultats de XM ont d'abord été prédits théoriquement, puis vérifiés expérimentalement, ce qui est assez rare dans le monde de l'apprentissage profond où la norme est plutôt « exécuter les expériences d'abord, expliquer ensuite ».

Les auteurs reconnaissent aussi franchement les limites : l'idée de best-of-K n'est pas nouvelle en soi, elle a été essayée plusieurs fois auparavant ; leur véritable contribution est d'avoir clarifié ce que fait réellement cette simple boucle : elle amplifie directement l'expressivité générative sans décomposer le processus de génération.

De plus, les modèles de langage autorégressifs restent l'os le plus dur à ronger, le XM Forward purement end-to-end est encore trop coûteux pour les distributions extrêmement multimodales (comme la génération d'images), et ces questions restent ouvertes pour les travaux futurs.

Pendant plus de dix ans, nous nous sommes habitués à régler les modèles génératifs avec deux boutons : les rendre plus grands, leur donner plus de données.

Le troisième bouton proposé par cet article est assez simple : laisser le modèle deviner plusieurs fois et ne garder que la meilleure tentative. Mais si la tendance qu'il révèle se confirme, alors à mesure que l'échelle continue de croître, les deux premiers boutons finiront par atteindre leurs limites, tandis que le troisième commence tout juste à tourner.

Liens de référence

https://x.com/AlexiGlad/status/2083230922196107288

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Panda

Трендові криптовалюти

Пов'язані питання

QQuel est le principal défi que les modèles génératifs traditionnels rencontrent en matière de formation et d'inférence, selon l'article ?

ALe principal défi est l'«exposition bias» (biais d'exposition). Les modèles génératifs traditionnels ne sont pas formés de bout en bout (end-to-end). Ils apprennent à prédire une «petite étape» pendant l'entraînement, mais lors de l'inférence, ils doivent dérouler cette étape des centaines ou milliers de fois, ce qui entraîne une accumulation d'erreurs et une dérive de la distribution d'entrée.

QQuel est le nom du nouveau paradigme présenté dans l'article et quel est son mécanisme central ?

ALe nouveau paradigme s'appelle «Explorative Modeling» (Modélisation exploratoire), abrégé XM. Son mécanisme central est une boucle 'for' simple où, à chaque étape d'entraînement, le modèle génère K candidats, puis ne retient et n'utilise pour la rétropropagation du gradient que le candidat le plus proche des données réelles.

QQuel problème fondamental de l'apprentissage par reconstruction l'«Explorative Modeling» vise-t-il à résoudre ?

AIl vise à résoudre le problème de «mode blurring» (flou des modes) ou de «mode moyenne». Avec une perte de reconstruction classique, face à plusieurs sorties valides multiples (modes), le modèle converge vers leur valeur moyenne, qui n'est souvent pas un échantillon réaliste. XM force le modèle à explorer et à couvrir les différents modes en ne pénalisant que le meilleur candidat parmi K.

QQuelle est la troisième dimension d'évolutivité (scaling) identifiée par les auteurs, en plus de la taille des modèles et des données ?

ALa troisième dimension d'évolutivité est «l'expressivité générative» (generative expressivity), qui est directement amplifiée par le facteur d'exploration K (le nombre de candidats générés). Les expériences montrent que les gains en performance augmentent de manière monotone avec K, et ce bénéfice devient encore plus important à plus grande échelle.

QQuel avantage principal un modèle génératif véritablement bout-en-bout (comme XM) offre-t-il lors de l'inférence par rapport aux modèles de diffusion ?

AL'avantage principal est l'efficacité d'inférence. Un modèle comme XM, formé de manière bout-en-bout avec de l'exploration, ne nécessite qu'un seul passage avant (forward pass) pour générer un échantillon. En revanche, un modèle de diffusion typique nécessite des centaines de passes avant itératives pendant l'inférence, ce qui est beaucoup plus coûteux en calcul.

Пов'язані матеріали

Bitcoin Price Drops to $62,470 as Sellers Retest $63,000 Support Level

Bitcoin's price fell below $63,000 for a second consecutive day on Friday, hitting an intraday low of $62,470. The cryptocurrency later recovered to trade just above $63,000, leaving it nearly flat for the past 24 hours and for August overall, with a weekly loss of 2.6%. The volatility triggered significant liquidations, with $26 million of leveraged long Bitcoin positions liquidated over 24 hours. Market sentiment was further dampened by data showing over $131 million in outflows from spot Bitcoin ETFs for a second straight day, signaling a potential pullback by institutional investors. Adding to the negative pressure, index provider MSCI has proposed new criteria for "non-operating companies" in its global indexes, which could lead to the exclusion of firms holding significant digital assets like Bitcoin on their balance sheets. Companies such as Strategy and Metaplanet could be affected, potentially forcing index-tracking funds to sell their shares. Strategy publicly criticized the proposal, arguing digital assets are legitimate assets and index providers should not dictate what companies can own. Public consultations on MSCI's proposal end September 30, with a final decision expected by October 16. If approved, exclusions could begin in November, potentially triggering sustained institutional selling and damaging a key bridge for Bitcoin adoption in the corporate sector.

cryptonews.ru2 год тому

Bitcoin Price Drops to $62,470 as Sellers Retest $63,000 Support Level

cryptonews.ru2 год тому

Торгівля

Спот

Популярні статті

Як купити CORE

Ласкаво просимо до HTX.com! Ми зробили покупку CORE (CORE) простою та зручною. Дотримуйтесь нашої покрокової інструкції, щоб розпочати свою криптовалютну подорож.Крок 1: Створіть обліковий запис на HTXВикористовуйте свою електронну пошту або номер телефону, щоб зареєструвати обліковий запис на HTX безплатно. Пройдіть безпроблемну реєстрацію й отримайте доступ до всіх функцій.ЗареєструватисьКрок 2: Перейдіть до розділу Купити крипту і виберіть спосіб оплатиКредитна/дебетова картка: використовуйте вашу картку Visa або Mastercard, щоб миттєво купити CORE (CORE).Баланс: використовуйте кошти з балансу вашого рахунку HTX для безперешкодної торгівлі.Треті особи: ми додали популярні способи оплати, такі як Google Pay та Apple Pay, щоб підвищити зручність.P2P: Торгуйте безпосередньо з іншими користувачами на HTX.Позабіржова торгівля (OTC): ми пропонуємо індивідуальні послуги та конкурентні обмінні курси для трейдерів.Крок 3: Зберігайте свої CORE (CORE)Після придбання CORE (CORE) збережіть його у своєму обліковому записі на HTX. Крім того, ви можете відправити його в інше місце за допомогою блокчейн-переказу або використовувати його для торгівлі іншими криптовалютами.Крок 4: Торгівля CORE (CORE)Легко торгуйте CORE (CORE) на спотовому ринку HTX. Просто увійдіть до свого облікового запису, виберіть торгову пару, укладайте угоди та спостерігайте за ними в режимі реального часу. Ми пропонуємо зручний досвід як для початківців, так і для досвідчених трейдерів.

397 переглядів усьогоОпубліковано 2024.12.13Оновлено 2026.06.02

Як купити CORE

Обговорення

Ласкаво просимо до спільноти HTX. Тут ви можете бути в курсі останніх подій розвитку платформи та отримати доступ до професійної ринкової інформації. Нижче представлені думки користувачів щодо ціни CORE (CORE).

活动图片