# Diffusion Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Diffusion", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Nouveau travail de l'équipe de Kaiming He : En supprimant le VAE et les données privées, la génération d'images à partir de texte devient encore plus performante

Le domaine de la génération d'images à partir de texte est un marché très compétitif, où les approches dominantes reposent souvent sur des architectures complexes comprenant des encodeurs VAE, d'énormes volumes de données privées et des étapes d'alignement coûteuses. Cependant, l'équipe de Kaiming He propose **MiniT2I**, un modèle de génération texte-image délibérément minimaliste qui remet en question ce paradigme. MiniT2I s'entraîne directement sur les pixels, éliminant le besoin d'un encodeur VAE, ce qui réduit les coûts de calcul et évite les erreurs de reconstruction. Son architecture **MM-JiT**, basée sur un Transformer, supprime les mécanismes d'injection conditionnelle complexes (comme AdaLN) et les fonctions de perte auxiliaires. À la place, elle utilise des adaptateurs texte légers et exploite le bruit de l'image lui-même pour représenter l'information temporelle. Le modèle est entraîné uniquement sur des données publiques en deux phases : un pré-entraînement sur CC12M recaptioned par LLaVA, suivi d'un fine-tuning sur environ 120 000 paires image-texte de haute qualité. Avec seulement 258 millions de paramètres, la version B/16 de MiniT2I surpasse des modèles pixel-space plusieurs fois plus grands sur des benchmarks comme GenEval (0.87) et DPG-Bench (84.2). L'approche démontre qu'il est possible d'obtenir des performances compétitives avec une architecture simplifiée, des données ouvertes et des ressources de calcul académiques, suggérant un possible changement de paradigme dans le domaine. Les limitations actuelles incluent des artefacts aux frontières des patchs, des effets secondaires du CFG à fort coefficient, et des difficultés avec le rendu de texte et des résolutions très élevées.

marsbit06/22 10:21

Nouveau travail de l'équipe de Kaiming He : En supprimant le VAE et les données privées, la génération d'images à partir de texte devient encore plus performante

marsbit06/22 10:21

活动图片