Les modèles génératifs peuvent aussi être entraînés de bout en bout ? Le noyau est en fait une boucle for

marsbitОпубликовано 2026-08-03Обновлено 2026-08-03

Введение

En 2012, AlexNet a révolutionné l'apprentissage profond en introduisant l'entraînement de bout en bout, où le modèle apprend une tâche complète en une seule fois, surpassant les approches par étapes conçues par l'homme. Cependant, les modèles génératifs actuels, comme les modèles autorégressifs ou de diffusion, font exception : ils sont entraînés à prédire une seule petite étape, puis doivent dérouler cette étape des centaines de fois lors de l'inférence. Cet écart entre l'entraînement et l'inférence entraîne un biais d'exposition (exposure bias), où les erreurs s'accumulent. Un récent article de l'Université de l'Illinois et de Harvard propose un nouveau paradigme, appelé Modélisation Exploratoire (Explorative Modeling, ou XM), pour résoudre ce problème. L'idée centrale est simple : au lieu de générer un seul échantillon par étape d'entraînement, le modèle en génère K, puis ne garde que le plus proche des données réelles pour calculer la perte et mettre à jour les paramètres. Cette boucle d'exploration, implémentée en quelques lignes de code, permet au modèle de capturer plusieurs modes de la distribution de données, évitant ainsi le flou modal (mode blurring) où le modèle converge vers une moyenne peu réaliste. Les auteurs démontrent que cette "expressivité générative" agit comme un troisième axe d'optimisation, indépendant de la taille du modèle ou des données. Les résultats montrent des gains croissants avec l'échelle : l'exploration améliore l'efficacité des FLOPs d'un...

En 2012, AlexNet a mis fin à une ère par une victoire écrasante. Avant cela, la reconnaissance d'images nécessitait une conception manuelle, étape par étape, de l'extraction des caractéristiques ; AlexNet a prouvé quelque chose qui a été maintes fois vérifié depuis : confier l'intégralité de la tâche de façon end-to-end au modèle pour qu'il apprenne par lui-même bat presque toujours les pipelines en plusieurs étapes soigneusement conçus par l'homme.

De la classification d'images à la détection d'objets en passant par la segmentation, derrière chaque bond en avant du deep learning, on retrouve la même maxime : laissons-le tout apprendre d'un seul coup.

Un seul domaine est resté une exception : les modèles génératifs.

Aujourd'hui, les modèles génératifs les plus puissants et les plus extensibles (qu'ils soient autorégressifs ou par diffusion) ne sont pas end-to-end.

À l'entraînement, ils n'apprennent qu'à prédire un « petit pas », mais à l'inférence, il faut dérouler ce pas des centaines, voire des milliers de fois, comme un réseau récurrent.

L'entraînement et l'inférence n'utilisent pas le même schéma d'échantillonnage. Cette fissure engendre un vieux problème : l'erreur de chaque étape est transmise à la suivante, l'entrée dérive progressivement de la distribution observée pendant l'entraînement, et les erreurs s'accumulent. On appelle cela académiquement le biais d'exposition (exposure bias).

En d'autres termes, cette expérience centrale du deep learning, « end-to-end est meilleur », n'a jamais vraiment été appliquée aux modèles génératifs au cours des quinze dernières années.

Et tout récemment, un article de l'UIUC et de l'Université Harvard tente de compléter cette dernière pièce du puzzle.

Les auteurs ont donné à ce nouveau paradigme le nom de Modélisation Exploratoire (Explorative Modeling), abrégé XM. Son idée est simple, voire naïve, mais pointe vers une conclusion audacieuse : les modèles génératifs, en plus des paramètres et des données, ont en réalité un troisième axe sur lequel on peut jouer.

Site du projet : https://explorative-modeling.github.io

Lien de l'article : https://arxiv.org/abs/2607.27372

Dépôt de code : https://github.com/alexiglad/XM

La racine du problème : le modèle ne sait que « faire la moyenne »

Pour comprendre ce que cet article cherche à résoudre, il faut d'abord comprendre ce qui rend la génération difficile.

L'apprentissage supervisé classique (comme la classification) a généralement une seule bonne réponse par entrée, il suffit donc que le modèle apprenne un mapping déterminé.

Mais la génération est différente. Demandez au modèle de « générer un chien », et les bonnes réponses peuvent même être infinies. Ces sorties légitimes sont les différents modes de la distribution de données (c'est-à-dire les pics indépendants dans la distribution). La génération est difficile précisément parce qu'il faut capter simultanément tous ces modes.

Le problème est que les modèles génératifs dominants utilisent une perte de reconstruction (comme l'erreur quadratique) à l'entraînement. Lorsqu'une entrée est associée de manière aléatoire à plusieurs cibles légitimes différentes, la solution optimale que peut donner une perte de reconstruction est la moyenne de ces cibles. Et pour la grande majorité des données, cette moyenne ne se trouve pas sur la variété des données, mais entre les modes, ne ressemblant à aucun d'eux.

L'illustration dans l'article est intuitive : si l'on demande à un modèle de faire une régression directe end-to-end sans aucune astuce, trois nuages de points seront prédits comme un point central unique, une photo de chien sera floue, une phrase dégénérera en une répétition infinie de « the ». C'est le flou des modes (mode blurring), où la solution optimale est justement la réponse qui ressemble le moins aux données réelles.

Comment les modèles existants contournent-ils cela ? La réponse est de décomposer l'acte de « génération ». L'autorégression ne prédit qu'un seul élément à la fois, la diffusion n'enlève qu'un peu de bruit à la fois, chaque petit pas voit sa cible réduite à presque un seul mode, de sorte que la perte de reconstruction n'a plus à faire de moyenne.

Ce principe de « décomposition du processus de génération » est précisément ce qui permet aux modèles de diffusion et autorégressifs de produire des échantillons de haute qualité, mais c'est aussi ce qui les empêche d'être end-to-end.

Les auteurs posent alors une question cruciale : un modèle génératif n'a que deux choses à décomposer : comment générer, et comment s'entraîner.

Puisque décomposer la génération détruit l'approche end-to-end, pourquoi ne pas décomposer l'entraînement ?

Une boucle for : tout le noyau de la modélisation exploratoire

La Modélisation Exploratoire décompose la boucle d'entraînement elle-même.

Son mécanisme peut se résumer en une phrase : à chaque étape d'entraînement, le modèle ne génère plus un seul échantillon pour s'approcher de la cible, mais génère K candidats, puis ne sélectionne que celui qui est le plus proche des données réelles pour l'entraînement et la rétropropagation du gradient. Dans l'article, cela est implémenté sous forme d'une boucle for de 3 à 5 lignes, d'une simplicité qui laisse presque perplexe (Algorithme 1).

Pourquoi cela résout-il le flou des modes ?

Imaginons une autre situation de la vie quotidienne : deviner où une fléchette va atterrir. Si vous ne pouvez faire qu'une seule prédiction, votre stratégie optimale est de deviner la position moyenne de toutes les fléchettes, mais c'est souvent un endroit du tableau où aucune ou très peu de fléchettes ne se sont plantées. En revanche, si vous avez le droit de faire K prédictions et que seule la plus proche compte, la stratégie optimale change immédiatement : vous allez disperser ces prédictions pour que chacune couvre un groupe différent de points d'impact.

Il en va de même pour le modèle. Lorsqu'on lui permet d'explorer K candidats, les différentes entrées de bruit vont chacune « s'approprier » un mode différent, au lieu de se précipiter toutes vers le centre pour faire la moyenne. Le nombre d'explorations détermine combien de modes le modèle peut capturer de manière stable.

Les auteurs donnent un nom à cette capacité longtemps négligée : l'expressivité générative (generative expressivity), et soulignent qu'elle est déterminée par l'objectif d'entraînement lui-même ; peu importe l'augmentation des paramètres ou des données, elle n'augmentera pas d'elle-même.

Cela explique aussi un phénomène étrange observé depuis longtemps dans le domaine : pourquoi les meilleurs modèles d'aujourd'hui dépendent-ils autant des techniques de « guidage » (guidance) ?

Le guidage sans classificateur consiste essentiellement à « éloigner » la prédiction de cette moyenne floue. Mais si le modèle n'est pas flou lui-même, pourquoi le pousser ? L'utilité du guidage provient précisément de la racine du problème qu'est le flou des modes.

L'article présente aussi deux directions d'exploration : Forward et Reverse. La première fixe une cible réelle et recherche parmi ses propres générations celle qui est la plus proche, favorisant le « rappel » (couverture de tous les modes). La seconde fixe une génération et recherche dans les données réelles la plus proche, favorisant la « précision », avec presque aucun coût de calcul supplémentaire, mais au risque de s'effondrer sur quelques modes seulement. Ces deux approches sont complémentaires et peuvent être combinées.

Le troisième axe : plus on l'amplifie, plus les bénéfices sont grands

La conclusion la plus significative de cet article est qu'il vérifie que l'« exploration » est un véritable axe d'échelle (scaling axis).

Les auteurs ajoutent l'exploration à des modèles de diffusion/flux, des modèles Jumpy et même des modèles de langage par diffusion masquée, et observent une amélioration monotone des performances sur trois modalités : image, vidéo et langage. Plus crucial encore, la tendance des bénéfices en fonction de l'échelle : plus on augmente la taille, plus l'amélioration est marquée.

Les chiffres donnés dans l'article sont les suivants : à mesure que la taille des données augmente, le gain apporté par l'exploration passe de 7 % à 36 % ; à mesure que le modèle grandit, il passe de 13 % à 23 % ; lorsque la puissance de calcul triple, le gain d'efficacité plus que double.

En termes d'efficacité, l'exploration améliore l'efficacité en FLOPs par un facteur de 4,1, l'efficacité en échantillons par un facteur de 6,2 et l'efficacité en paramètres de 47 %. Pour la génération d'images, elle pousse la recette RAE actuellement la plus puissante à un FID de 1,43 sans guidage sur ImageNet, approchant les meilleurs niveaux du domaine.

Un grand modèle explorant 5 modes peut même surpasser un très grand modèle avec 47 % de paramètres supplémentaires mais sans exploration.

Cette tendance n'est pas anodine. L'explication des auteurs est la suivante : à petite échelle, le modèle est principalement limité par les paramètres et les données, l'expressivité générative n'étant pas encore le goulot d'étranglement ; mais une fois que les paramètres et les données sont suffisamment grands pour ne plus être une limite, l'expressivité générative devient de plus en plus le véritable goulot d'étranglement. Et c'est précisément ce que l'exploration peut amplifier directement.

Considérant que l'entraînement des vrais modèles de base d'aujourd'hui utilise une puissance de calcul environ 10 000 fois supérieure à celle de la plus grande expérience de cet article, les auteurs pensent que les chiffres rapportés dans l'article ne sont probablement que la limite inférieure des bénéfices à plus grande échelle.

La génération véritablement end-to-end

Si l'on pousse l'exploration à l'extrême, que se passe-t-il ? La réponse ramène à la question initiale : les modèles génératifs peuvent enfin être end-to-end.

Les auteurs utilisent XM comme un modèle indépendant end-to-end pour des tâches de contrôle robotique. En imitation comportementale (Behavior Cloning), leur politique exploratoire (Explorative Policy) n'utilise qu'une seule passe avant du réseau pour égaler, voire surpasser, la politique par diffusion (Diffusion Policy) qui nécessite 100 passes avant ; en modélisation du monde orientée vers un but (goal-conditioned world modeling), le modèle exploratoire du monde (Explorative World Model) utilise de 16 à 256 fois moins de calculs d'inférence que le Diffuser, tout en obtenant de meilleures performances moyennes.

La source de cet écart est claire : les modèles de diffusion utilisent des centaines d'étapes de génération à l'inférence pour obtenir de l'expressivité, tandis que le XM end-to-end déplace ce coût vers l'exploration à l'entraînement, l'inférence ne nécessitant ainsi qu'une seule passe avant. La même tâche de « gérer plusieurs modes » peut être décomposée lentement à l'inférence, ou explorée en une fois pendant l'entraînement ; cet article choisit la seconde option.

Présentation des auteurs

Le premier auteur de cet article, Alexi Gladstone, n'est pas inconnu. En juillet 2025, ses Transformateurs à Base d'Énergie (Energy-Based Transformers, EBT) avaient déjà suscité de nombreuses discussions sur les réseaux sociaux.

Ce travail prétendait pour la première fois « surpasser » la courbe d'échelle du Transformer à propagation avant standard sur plusieurs dimensions, et cherchait à étendre la « pensée de type System 2 » à un mode arbitraire. Voir l'article de Machine Heart : « Un nouveau paradigme arrive ! Le nouveau modèle énergétique brise les limites d'extension de Transformer++, taux d'extension à l'entraînement 35% plus rapide ».

La Modélisation Exploratoire s'inscrit dans la continuité de sa démarche constante : questionner si « un modèle peut, par une certaine forme de recherche, d'exploration, accomplir ce qu'une seule passe avant ne peut pas faire ». Cet article s'appuie également sur une autre théorie développée avec ses collaborateurs (Yilun Du et Heng Ji) : Mode Forcing. L'article admet que, précisément parce que cette théorie existait au préalable, la plupart des résultats de XM ont d'abord été prédits théoriquement, puis vérifiés expérimentalement, ce qui est assez rare dans le monde de l'apprentissage profond où la norme est plutôt « exécuter les expériences d'abord, expliquer ensuite ».

Les auteurs reconnaissent aussi franchement les limites : l'idée de best-of-K n'est pas nouvelle en soi, elle a été essayée plusieurs fois auparavant ; leur véritable contribution est d'avoir clarifié ce que fait réellement cette simple boucle : elle amplifie directement l'expressivité générative sans décomposer le processus de génération.

De plus, les modèles de langage autorégressifs restent l'os le plus dur à ronger, le XM Forward purement end-to-end est encore trop coûteux pour les distributions extrêmement multimodales (comme la génération d'images), et ces questions restent ouvertes pour les travaux futurs.

Pendant plus de dix ans, nous nous sommes habitués à régler les modèles génératifs avec deux boutons : les rendre plus grands, leur donner plus de données.

Le troisième bouton proposé par cet article est assez simple : laisser le modèle deviner plusieurs fois et ne garder que la meilleure tentative. Mais si la tendance qu'il révèle se confirme, alors à mesure que l'échelle continue de croître, les deux premiers boutons finiront par atteindre leurs limites, tandis que le troisième commence tout juste à tourner.

Liens de référence

https://x.com/AlexiGlad/status/2083230922196107288

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Panda

Трендовые криптовалюты

Связанные с этим вопросы

QQuel est le principal défi que les modèles génératifs traditionnels rencontrent en matière de formation et d'inférence, selon l'article ?

ALe principal défi est l'«exposition bias» (biais d'exposition). Les modèles génératifs traditionnels ne sont pas formés de bout en bout (end-to-end). Ils apprennent à prédire une «petite étape» pendant l'entraînement, mais lors de l'inférence, ils doivent dérouler cette étape des centaines ou milliers de fois, ce qui entraîne une accumulation d'erreurs et une dérive de la distribution d'entrée.

QQuel est le nom du nouveau paradigme présenté dans l'article et quel est son mécanisme central ?

ALe nouveau paradigme s'appelle «Explorative Modeling» (Modélisation exploratoire), abrégé XM. Son mécanisme central est une boucle 'for' simple où, à chaque étape d'entraînement, le modèle génère K candidats, puis ne retient et n'utilise pour la rétropropagation du gradient que le candidat le plus proche des données réelles.

QQuel problème fondamental de l'apprentissage par reconstruction l'«Explorative Modeling» vise-t-il à résoudre ?

AIl vise à résoudre le problème de «mode blurring» (flou des modes) ou de «mode moyenne». Avec une perte de reconstruction classique, face à plusieurs sorties valides multiples (modes), le modèle converge vers leur valeur moyenne, qui n'est souvent pas un échantillon réaliste. XM force le modèle à explorer et à couvrir les différents modes en ne pénalisant que le meilleur candidat parmi K.

QQuelle est la troisième dimension d'évolutivité (scaling) identifiée par les auteurs, en plus de la taille des modèles et des données ?

ALa troisième dimension d'évolutivité est «l'expressivité générative» (generative expressivity), qui est directement amplifiée par le facteur d'exploration K (le nombre de candidats générés). Les expériences montrent que les gains en performance augmentent de manière monotone avec K, et ce bénéfice devient encore plus important à plus grande échelle.

QQuel avantage principal un modèle génératif véritablement bout-en-bout (comme XM) offre-t-il lors de l'inférence par rapport aux modèles de diffusion ?

AL'avantage principal est l'efficacité d'inférence. Un modèle comme XM, formé de manière bout-en-bout avec de l'exploration, ne nécessite qu'un seul passage avant (forward pass) pour générer un échantillon. En revanche, un modèle de diffusion typique nécessite des centaines de passes avant itératives pendant l'inférence, ce qui est beaucoup plus coûteux en calcul.

Похожее

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

Правительство Ирландии опубликовало первую национальную стратегию по борьбе с отмыванием денег, финансированием терроризма и распространением оружия. Документ включает меры по регулированию криптоактивов для противодействия их использованию в незаконных целях. Стратегия предполагает введение новых обязательств для поставщиков услуг с криптоактивами, усиление проверок транзакций с частными кошельками и более строгую проверку зарубежных криптокомпаний. Ирландия планирует внедрить эти отраслевые стандарты, соответствующие европейскому регламенту MiCA, во второй половине 2027 года. Стратегия также затрагивает вопросы использования криптоактивов в качестве источника средств для азартных игр.

cointelegraph58 мин. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

cointelegraph58 мин. назад

Grayscale: «Если предложения будут приняты, цены на эти два альткоина могут вырасти»

Глава исследовательского отдела Grayscale Зак Пандл заявил, что обсуждаемые в сообществах Ethereum ($ETH) и Solana ($SOL) изменения в токеномике, направленные на снижение инфляции предложения, могут замедлить рост выпуска новых монет. Это потенциально создаст дефицит и окажет повышательное давление на цены. По оценкам Grayscale, в случае реализации изменений годовая инфляция предложения ETH может снизиться до ~0.4% к концу 2031 года (близко к показателям Bitcoin), а для SOL — до ~1.1%. Для сравнения, ежегодный прирост предложения золота составляет ~1.8%. Пандл отмечает, что предложения по Solana, по-видимому, имеют больше шансов на реализацию. Однако снижение инфляции может также уменьшить вознаграждения для стейкеров, так как значительная часть их дохода формируется за счет эмиссии новых токенов. Выгоду от возможного роста цен в первую очередь получат инвесторы, владеющие токенами без стейкинга. Предложения пока не утверждены окончательно.

cryptonews.ru1 ч. назад

Grayscale: «Если предложения будут приняты, цены на эти два альткоина могут вырасти»

cryptonews.ru1 ч. назад

Эксперты назвали причины падения биткоина после снижения инфляции в США

Благоприятные данные по инфляции в США в июле, соответствовавшие или превзошедшие ожидания, не привели к росту биткоина. Эксперты CryptoQuant видят основную причину в слабом спотовом спросе. Приток в американские биткоин-ETF остаётся низким, а индекс Coinbase Premium, указывающий на активность инвесторов из США, сохраняется в отрицательной зоне. Это свидетельствует об ограниченном покупательном давлении. При этом позиции на фьючерсном рынке остаются высокими, создавая дисбаланс: слабая ликвидность и спрос при значительном объёме маржинальных позиций. В таких условиях даже позитивные макроновости могут не спровоцировать рост, а скорее привести к закрытию лонгов и дальнейшему давлению на цену. Ключевым уровнем сопротивления названа отметка около $68 700. Для возобновления устойчивого роста рынку, по мнению аналитиков, необходим возобновлённый приток в ETF, рост спотовых объёмов, переход Coinbase Premium в плюс и уверенное закрепление биткоина выше $68 700.

cryptonews.ru2 ч. назад

Эксперты назвали причины падения биткоина после снижения инфляции в США

cryptonews.ru2 ч. назад

Курс биткоина опустился до 62 470 долларов, поскольку продавцы вновь тестируют уровень поддержки в 63 000 долларов

Курс биткоина в пятницу продолжил снижение, вновь опустившись ниже уровня поддержки в 63 000 долларов и достигнув дневного минимума в 62 470 долларов. Несмотря на последующее восстановление до отметки около 63 000 долларов, динамика цены оставалась вялой, а рыночная капитализация удерживалась ниже 1,27 трлн долларов. На рынке усилилась волатильность, приведя к значительным ликвидациям длинных позиций с кредитным плечом. Дополнительное давление оказал устойчивый отток средств из спотовых биткоин-ETF, что говорит о возможном отступлении институциональных инвесторов. Ситуацию усугубило предложение провайдера индексов MSCI о новых критериях отбора, которые могут привести к исключению из индексов компаний, активно использующих биткоин в казначейских резервах, таких как Strategy и Metaplanet. Это потенциально спровоцирует их принудительную распродажу институциональными фондами. Strategy публично осудила данную инициативу, заявив, что поставщики индексов должны измерять рынки, а не диктовать компаниям, какими активами владеть. Окончательное решение MSCI ожидается в октябре, и в случае принятия новые правила могут начать действовать уже в ноябре, создавая дополнительные препятствия для роста биткоина в конце года.

cryptonews.ru2 ч. назад

Курс биткоина опустился до 62 470 долларов, поскольку продавцы вновь тестируют уровень поддержки в 63 000 долларов

cryptonews.ru2 ч. назад

Торговля

Спот

Популярные статьи

Как купить CORE

Добро пожаловать на HTX.com! Мы сделали приобретение CORE (CORE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки CORE (CORE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение CORE (CORE)После приобретения вами CORE (CORE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля CORE (CORE)С легкостью торгуйте CORE (CORE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

769 просмотров всегоОпубликовано 2024.03.29Обновлено 2026.06.02

Как купить CORE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на CORE (CORE) представлены ниже.

活动图片