Les modèles génératifs peuvent aussi être entraînés de bout en bout ? Le noyau est en fait une boucle for

marsbitPublié le 2026-08-03Dernière mise à jour le 2026-08-03

Résumé

En 2012, AlexNet a révolutionné l'apprentissage profond en introduisant l'entraînement de bout en bout, où le modèle apprend une tâche complète en une seule fois, surpassant les approches par étapes conçues par l'homme. Cependant, les modèles génératifs actuels, comme les modèles autorégressifs ou de diffusion, font exception : ils sont entraînés à prédire une seule petite étape, puis doivent dérouler cette étape des centaines de fois lors de l'inférence. Cet écart entre l'entraînement et l'inférence entraîne un biais d'exposition (exposure bias), où les erreurs s'accumulent. Un récent article de l'Université de l'Illinois et de Harvard propose un nouveau paradigme, appelé Modélisation Exploratoire (Explorative Modeling, ou XM), pour résoudre ce problème. L'idée centrale est simple : au lieu de générer un seul échantillon par étape d'entraînement, le modèle en génère K, puis ne garde que le plus proche des données réelles pour calculer la perte et mettre à jour les paramètres. Cette boucle d'exploration, implémentée en quelques lignes de code, permet au modèle de capturer plusieurs modes de la distribution de données, évitant ainsi le flou modal (mode blurring) où le modèle converge vers une moyenne peu réaliste. Les auteurs démontrent que cette "expressivité générative" agit comme un troisième axe d'optimisation, indépendant de la taille du modèle ou des données. Les résultats montrent des gains croissants avec l'échelle : l'exploration améliore l'efficacité des FLOPs d'un...

En 2012, AlexNet a mis fin à une ère par une victoire écrasante. Avant cela, la reconnaissance d'images nécessitait une conception manuelle, étape par étape, de l'extraction des caractéristiques ; AlexNet a prouvé quelque chose qui a été maintes fois vérifié depuis : confier l'intégralité de la tâche de façon end-to-end au modèle pour qu'il apprenne par lui-même bat presque toujours les pipelines en plusieurs étapes soigneusement conçus par l'homme.

De la classification d'images à la détection d'objets en passant par la segmentation, derrière chaque bond en avant du deep learning, on retrouve la même maxime : laissons-le tout apprendre d'un seul coup.

Un seul domaine est resté une exception : les modèles génératifs.

Aujourd'hui, les modèles génératifs les plus puissants et les plus extensibles (qu'ils soient autorégressifs ou par diffusion) ne sont pas end-to-end.

À l'entraînement, ils n'apprennent qu'à prédire un « petit pas », mais à l'inférence, il faut dérouler ce pas des centaines, voire des milliers de fois, comme un réseau récurrent.

L'entraînement et l'inférence n'utilisent pas le même schéma d'échantillonnage. Cette fissure engendre un vieux problème : l'erreur de chaque étape est transmise à la suivante, l'entrée dérive progressivement de la distribution observée pendant l'entraînement, et les erreurs s'accumulent. On appelle cela académiquement le biais d'exposition (exposure bias).

En d'autres termes, cette expérience centrale du deep learning, « end-to-end est meilleur », n'a jamais vraiment été appliquée aux modèles génératifs au cours des quinze dernières années.

Et tout récemment, un article de l'UIUC et de l'Université Harvard tente de compléter cette dernière pièce du puzzle.

Les auteurs ont donné à ce nouveau paradigme le nom de Modélisation Exploratoire (Explorative Modeling), abrégé XM. Son idée est simple, voire naïve, mais pointe vers une conclusion audacieuse : les modèles génératifs, en plus des paramètres et des données, ont en réalité un troisième axe sur lequel on peut jouer.

Site du projet : https://explorative-modeling.github.io

Lien de l'article : https://arxiv.org/abs/2607.27372

Dépôt de code : https://github.com/alexiglad/XM

La racine du problème : le modèle ne sait que « faire la moyenne »

Pour comprendre ce que cet article cherche à résoudre, il faut d'abord comprendre ce qui rend la génération difficile.

L'apprentissage supervisé classique (comme la classification) a généralement une seule bonne réponse par entrée, il suffit donc que le modèle apprenne un mapping déterminé.

Mais la génération est différente. Demandez au modèle de « générer un chien », et les bonnes réponses peuvent même être infinies. Ces sorties légitimes sont les différents modes de la distribution de données (c'est-à-dire les pics indépendants dans la distribution). La génération est difficile précisément parce qu'il faut capter simultanément tous ces modes.

Le problème est que les modèles génératifs dominants utilisent une perte de reconstruction (comme l'erreur quadratique) à l'entraînement. Lorsqu'une entrée est associée de manière aléatoire à plusieurs cibles légitimes différentes, la solution optimale que peut donner une perte de reconstruction est la moyenne de ces cibles. Et pour la grande majorité des données, cette moyenne ne se trouve pas sur la variété des données, mais entre les modes, ne ressemblant à aucun d'eux.

L'illustration dans l'article est intuitive : si l'on demande à un modèle de faire une régression directe end-to-end sans aucune astuce, trois nuages de points seront prédits comme un point central unique, une photo de chien sera floue, une phrase dégénérera en une répétition infinie de « the ». C'est le flou des modes (mode blurring), où la solution optimale est justement la réponse qui ressemble le moins aux données réelles.

Comment les modèles existants contournent-ils cela ? La réponse est de décomposer l'acte de « génération ». L'autorégression ne prédit qu'un seul élément à la fois, la diffusion n'enlève qu'un peu de bruit à la fois, chaque petit pas voit sa cible réduite à presque un seul mode, de sorte que la perte de reconstruction n'a plus à faire de moyenne.

Ce principe de « décomposition du processus de génération » est précisément ce qui permet aux modèles de diffusion et autorégressifs de produire des échantillons de haute qualité, mais c'est aussi ce qui les empêche d'être end-to-end.

Les auteurs posent alors une question cruciale : un modèle génératif n'a que deux choses à décomposer : comment générer, et comment s'entraîner.

Puisque décomposer la génération détruit l'approche end-to-end, pourquoi ne pas décomposer l'entraînement ?

Une boucle for : tout le noyau de la modélisation exploratoire

La Modélisation Exploratoire décompose la boucle d'entraînement elle-même.

Son mécanisme peut se résumer en une phrase : à chaque étape d'entraînement, le modèle ne génère plus un seul échantillon pour s'approcher de la cible, mais génère K candidats, puis ne sélectionne que celui qui est le plus proche des données réelles pour l'entraînement et la rétropropagation du gradient. Dans l'article, cela est implémenté sous forme d'une boucle for de 3 à 5 lignes, d'une simplicité qui laisse presque perplexe (Algorithme 1).

Pourquoi cela résout-il le flou des modes ?

Imaginons une autre situation de la vie quotidienne : deviner où une fléchette va atterrir. Si vous ne pouvez faire qu'une seule prédiction, votre stratégie optimale est de deviner la position moyenne de toutes les fléchettes, mais c'est souvent un endroit du tableau où aucune ou très peu de fléchettes ne se sont plantées. En revanche, si vous avez le droit de faire K prédictions et que seule la plus proche compte, la stratégie optimale change immédiatement : vous allez disperser ces prédictions pour que chacune couvre un groupe différent de points d'impact.

Il en va de même pour le modèle. Lorsqu'on lui permet d'explorer K candidats, les différentes entrées de bruit vont chacune « s'approprier » un mode différent, au lieu de se précipiter toutes vers le centre pour faire la moyenne. Le nombre d'explorations détermine combien de modes le modèle peut capturer de manière stable.

Les auteurs donnent un nom à cette capacité longtemps négligée : l'expressivité générative (generative expressivity), et soulignent qu'elle est déterminée par l'objectif d'entraînement lui-même ; peu importe l'augmentation des paramètres ou des données, elle n'augmentera pas d'elle-même.

Cela explique aussi un phénomène étrange observé depuis longtemps dans le domaine : pourquoi les meilleurs modèles d'aujourd'hui dépendent-ils autant des techniques de « guidage » (guidance) ?

Le guidage sans classificateur consiste essentiellement à « éloigner » la prédiction de cette moyenne floue. Mais si le modèle n'est pas flou lui-même, pourquoi le pousser ? L'utilité du guidage provient précisément de la racine du problème qu'est le flou des modes.

L'article présente aussi deux directions d'exploration : Forward et Reverse. La première fixe une cible réelle et recherche parmi ses propres générations celle qui est la plus proche, favorisant le « rappel » (couverture de tous les modes). La seconde fixe une génération et recherche dans les données réelles la plus proche, favorisant la « précision », avec presque aucun coût de calcul supplémentaire, mais au risque de s'effondrer sur quelques modes seulement. Ces deux approches sont complémentaires et peuvent être combinées.

Le troisième axe : plus on l'amplifie, plus les bénéfices sont grands

La conclusion la plus significative de cet article est qu'il vérifie que l'« exploration » est un véritable axe d'échelle (scaling axis).

Les auteurs ajoutent l'exploration à des modèles de diffusion/flux, des modèles Jumpy et même des modèles de langage par diffusion masquée, et observent une amélioration monotone des performances sur trois modalités : image, vidéo et langage. Plus crucial encore, la tendance des bénéfices en fonction de l'échelle : plus on augmente la taille, plus l'amélioration est marquée.

Les chiffres donnés dans l'article sont les suivants : à mesure que la taille des données augmente, le gain apporté par l'exploration passe de 7 % à 36 % ; à mesure que le modèle grandit, il passe de 13 % à 23 % ; lorsque la puissance de calcul triple, le gain d'efficacité plus que double.

En termes d'efficacité, l'exploration améliore l'efficacité en FLOPs par un facteur de 4,1, l'efficacité en échantillons par un facteur de 6,2 et l'efficacité en paramètres de 47 %. Pour la génération d'images, elle pousse la recette RAE actuellement la plus puissante à un FID de 1,43 sans guidage sur ImageNet, approchant les meilleurs niveaux du domaine.

Un grand modèle explorant 5 modes peut même surpasser un très grand modèle avec 47 % de paramètres supplémentaires mais sans exploration.

Cette tendance n'est pas anodine. L'explication des auteurs est la suivante : à petite échelle, le modèle est principalement limité par les paramètres et les données, l'expressivité générative n'étant pas encore le goulot d'étranglement ; mais une fois que les paramètres et les données sont suffisamment grands pour ne plus être une limite, l'expressivité générative devient de plus en plus le véritable goulot d'étranglement. Et c'est précisément ce que l'exploration peut amplifier directement.

Considérant que l'entraînement des vrais modèles de base d'aujourd'hui utilise une puissance de calcul environ 10 000 fois supérieure à celle de la plus grande expérience de cet article, les auteurs pensent que les chiffres rapportés dans l'article ne sont probablement que la limite inférieure des bénéfices à plus grande échelle.

La génération véritablement end-to-end

Si l'on pousse l'exploration à l'extrême, que se passe-t-il ? La réponse ramène à la question initiale : les modèles génératifs peuvent enfin être end-to-end.

Les auteurs utilisent XM comme un modèle indépendant end-to-end pour des tâches de contrôle robotique. En imitation comportementale (Behavior Cloning), leur politique exploratoire (Explorative Policy) n'utilise qu'une seule passe avant du réseau pour égaler, voire surpasser, la politique par diffusion (Diffusion Policy) qui nécessite 100 passes avant ; en modélisation du monde orientée vers un but (goal-conditioned world modeling), le modèle exploratoire du monde (Explorative World Model) utilise de 16 à 256 fois moins de calculs d'inférence que le Diffuser, tout en obtenant de meilleures performances moyennes.

La source de cet écart est claire : les modèles de diffusion utilisent des centaines d'étapes de génération à l'inférence pour obtenir de l'expressivité, tandis que le XM end-to-end déplace ce coût vers l'exploration à l'entraînement, l'inférence ne nécessitant ainsi qu'une seule passe avant. La même tâche de « gérer plusieurs modes » peut être décomposée lentement à l'inférence, ou explorée en une fois pendant l'entraînement ; cet article choisit la seconde option.

Présentation des auteurs

Le premier auteur de cet article, Alexi Gladstone, n'est pas inconnu. En juillet 2025, ses Transformateurs à Base d'Énergie (Energy-Based Transformers, EBT) avaient déjà suscité de nombreuses discussions sur les réseaux sociaux.

Ce travail prétendait pour la première fois « surpasser » la courbe d'échelle du Transformer à propagation avant standard sur plusieurs dimensions, et cherchait à étendre la « pensée de type System 2 » à un mode arbitraire. Voir l'article de Machine Heart : « Un nouveau paradigme arrive ! Le nouveau modèle énergétique brise les limites d'extension de Transformer++, taux d'extension à l'entraînement 35% plus rapide ».

La Modélisation Exploratoire s'inscrit dans la continuité de sa démarche constante : questionner si « un modèle peut, par une certaine forme de recherche, d'exploration, accomplir ce qu'une seule passe avant ne peut pas faire ». Cet article s'appuie également sur une autre théorie développée avec ses collaborateurs (Yilun Du et Heng Ji) : Mode Forcing. L'article admet que, précisément parce que cette théorie existait au préalable, la plupart des résultats de XM ont d'abord été prédits théoriquement, puis vérifiés expérimentalement, ce qui est assez rare dans le monde de l'apprentissage profond où la norme est plutôt « exécuter les expériences d'abord, expliquer ensuite ».

Les auteurs reconnaissent aussi franchement les limites : l'idée de best-of-K n'est pas nouvelle en soi, elle a été essayée plusieurs fois auparavant ; leur véritable contribution est d'avoir clarifié ce que fait réellement cette simple boucle : elle amplifie directement l'expressivité générative sans décomposer le processus de génération.

De plus, les modèles de langage autorégressifs restent l'os le plus dur à ronger, le XM Forward purement end-to-end est encore trop coûteux pour les distributions extrêmement multimodales (comme la génération d'images), et ces questions restent ouvertes pour les travaux futurs.

Pendant plus de dix ans, nous nous sommes habitués à régler les modèles génératifs avec deux boutons : les rendre plus grands, leur donner plus de données.

Le troisième bouton proposé par cet article est assez simple : laisser le modèle deviner plusieurs fois et ne garder que la meilleure tentative. Mais si la tendance qu'il révèle se confirme, alors à mesure que l'échelle continue de croître, les deux premiers boutons finiront par atteindre leurs limites, tandis que le troisième commence tout juste à tourner.

Liens de référence

https://x.com/AlexiGlad/status/2083230922196107288

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Panda

Cryptos en tendance

Questions liées

QQuel est le principal défi que les modèles génératifs traditionnels rencontrent en matière de formation et d'inférence, selon l'article ?

ALe principal défi est l'«exposition bias» (biais d'exposition). Les modèles génératifs traditionnels ne sont pas formés de bout en bout (end-to-end). Ils apprennent à prédire une «petite étape» pendant l'entraînement, mais lors de l'inférence, ils doivent dérouler cette étape des centaines ou milliers de fois, ce qui entraîne une accumulation d'erreurs et une dérive de la distribution d'entrée.

QQuel est le nom du nouveau paradigme présenté dans l'article et quel est son mécanisme central ?

ALe nouveau paradigme s'appelle «Explorative Modeling» (Modélisation exploratoire), abrégé XM. Son mécanisme central est une boucle 'for' simple où, à chaque étape d'entraînement, le modèle génère K candidats, puis ne retient et n'utilise pour la rétropropagation du gradient que le candidat le plus proche des données réelles.

QQuel problème fondamental de l'apprentissage par reconstruction l'«Explorative Modeling» vise-t-il à résoudre ?

AIl vise à résoudre le problème de «mode blurring» (flou des modes) ou de «mode moyenne». Avec une perte de reconstruction classique, face à plusieurs sorties valides multiples (modes), le modèle converge vers leur valeur moyenne, qui n'est souvent pas un échantillon réaliste. XM force le modèle à explorer et à couvrir les différents modes en ne pénalisant que le meilleur candidat parmi K.

QQuelle est la troisième dimension d'évolutivité (scaling) identifiée par les auteurs, en plus de la taille des modèles et des données ?

ALa troisième dimension d'évolutivité est «l'expressivité générative» (generative expressivity), qui est directement amplifiée par le facteur d'exploration K (le nombre de candidats générés). Les expériences montrent que les gains en performance augmentent de manière monotone avec K, et ce bénéfice devient encore plus important à plus grande échelle.

QQuel avantage principal un modèle génératif véritablement bout-en-bout (comme XM) offre-t-il lors de l'inférence par rapport aux modèles de diffusion ?

AL'avantage principal est l'efficacité d'inférence. Un modèle comme XM, formé de manière bout-en-bout avec de l'exploration, ne nécessite qu'un seul passage avant (forward pass) pour générer un échantillon. En revanche, un modèle de diffusion typique nécessite des centaines de passes avant itératives pendant l'inférence, ce qui est beaucoup plus coûteux en calcul.

Lectures associées

Rubin Ultra réduit drastiquement sa configuration, NVIDIA cède-t-il face à la hausse du prix de la mémoire ?

Ces dernières heures, un rapport de la société de recherche SemiAnalysis a suscité de vives discussions dans le secteur de l'IA. Il révèle que NVIDIA aurait considérablement réduit les spécifications prévues pour sa puce phare Rubin Ultra, sa version haut de gamme de la plateforme Rubin annoncée cette année. Le changement le plus notable concerne la mémoire : la capacité HBM serait ramenée à 192 GB (empilage 8-Hi), soit moins que la version standard Rubin (288 GB en 12-Hi). La puissance de calcul théorique resterait identique à celle du Rubin, à 35 PFLOPs, et la bande passante mémoire ne progresserait que marginalement. Face à la flambée des prix du HBM – dont le coût a plus que triplé en un an – NVIDIA aurait repensé l'architecture pour en limiter l'impact sur le coût total. Ainsi, l'accent est désormais mis sur l'**interconnexion à grande échelle** : le système NVL576 permettrait de relier jusqu'à 576 GPU Rubin Ultra en un seul domaine de calcul via NVLink, offrant une capacité d'extension système bien supérieure. Cette réorientation stratégique, si elle est confirmée, suggère que NVIDIA optimise le rapport coût-performance en réduisant sa dépendance à des composants mémoire de plus en plus onéreux. Cette nouvelle a entraîné une chute des cours boursiers des principaux fabricants de mémoire, comme SK Hynix et Samsung, le marché craignant un potentiel plafonnement de la demande en HBM de la part du plus grand acheteur du secteur.

Odaily星球日报Il y a 5 mins

Rubin Ultra réduit drastiquement sa configuration, NVIDIA cède-t-il face à la hausse du prix de la mémoire ?

Odaily星球日报Il y a 5 mins

OpenAI ne compte plus sur son modèle le plus cher pour gagner de l'argent

OpenAI réduit considérablement ses prix : le modèle GPT-5.6 Luna baisse de 80 % et Terra de 20 %. Ce mouvement, accompagné par Anthropic qui propose aussi des alternatives moins chères, marque un tournant stratégique. Les géants de l'IA ne misent plus seulement sur leurs modèles "phares" les plus performants et chers (comme Sol ou Fable) pour générer des revenus, mais encouragent désormais l'utilisation de modèles intermédiaires (Luna, Terra, Opus) pour les tâches courantes et à grande échelle. L'idée est de créer un écosystème où les modèles se spécialisent : les plus intelligents conçoivent et planifient, tandis que les plus abordables exécutent. Cette approche, similaire à l'industrie automobile où les modèles grand public assurent les volumes, vise à verrouiller les flux de traitement à bas coût. Un point clé est l'optimisation automatique : OpenAI révèle que ses modèles avancés participent désormais à l'optimisation de leur propre code et de leur efficacité, créant une boucle vertueuse de réduction des coûts. L'objectif final n'est plus de vendre l'intelligence la plus pointue, mais de devenir la plateforme par défaut, avec une rentabilité basée sur le volume massif d'appels d'API à très faible coût. Le débat se déplace ainsi de "quel modèle est le plus intelligent ?" vers "quel écosystème offre le meilleur ROI ?". L'ambition est que l'IA, comme l'électricité, devienne une utilité omniprésente et peu coûteuse, intégrée silencieusement dans tous les processus.

marsbitIl y a 2 h

OpenAI ne compte plus sur son modèle le plus cher pour gagner de l'argent

marsbitIl y a 2 h

Trading

Spot

Articles tendance

Comment acheter CORE

Bienvenue sur HTX.com ! Nous vous permettons d'acheter CORE (CORE) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément CORE (CORE).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos CORE (CORE)Après avoir acheté vos CORE (CORE), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des CORE (CORE)Tradez facilement CORE (CORE) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

455 vues totalesPublié le 2024.12.13Mis à jour le 2026.06.02

Comment acheter CORE

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de CORE (CORE) sont présentées ci-dessous.

活动图片