Les modèles génératifs peuvent aussi être entraînés de bout en bout ? Le noyau est en fait une boucle for
En 2012, AlexNet a révolutionné l'apprentissage profond en introduisant l'entraînement de bout en bout, où le modèle apprend une tâche complète en une seule fois, surpassant les approches par étapes conçues par l'homme. Cependant, les modèles génératifs actuels, comme les modèles autorégressifs ou de diffusion, font exception : ils sont entraînés à prédire une seule petite étape, puis doivent dérouler cette étape des centaines de fois lors de l'inférence. Cet écart entre l'entraînement et l'inférence entraîne un biais d'exposition (exposure bias), où les erreurs s'accumulent.
Un récent article de l'Université de l'Illinois et de Harvard propose un nouveau paradigme, appelé Modélisation Exploratoire (Explorative Modeling, ou XM), pour résoudre ce problème. L'idée centrale est simple : au lieu de générer un seul échantillon par étape d'entraînement, le modèle en génère K, puis ne garde que le plus proche des données réelles pour calculer la perte et mettre à jour les paramètres. Cette boucle d'exploration, implémentée en quelques lignes de code, permet au modèle de capturer plusieurs modes de la distribution de données, évitant ainsi le flou modal (mode blurring) où le modèle converge vers une moyenne peu réaliste.
Les auteurs démontrent que cette "expressivité générative" agit comme un troisième axe d'optimisation, indépendant de la taille du modèle ou des données. Les résultats montrent des gains croissants avec l'échelle : l'exploration améliore l'efficacité des FLOPs d'un facteur 4,1, l'efficacité des échantillons de 6,2 et l'efficacité des paramètres de 47%. Sur ImageNet, XM atteint un FID de 1,43 sans guidage.
Appliqué de bout en bout, XM permet une inférence en une seule passe, rivalisant avec des modèles de diffusion nécessitant des centaines d'étapes, notamment dans des tâches de contrôle robotique. Bien que le concept de sélection du meilleur parmi K (best-of-K) ne soit pas nouveau, cette formalisation clarifie son rôle pour amplifier l'expressivité générative. Alors que les modèles continuent de grandir, cette troisième "molette" pourrait devenir déterminante.
marsbitIl y a 3 mins