NVIDIA MoE Nouveau Open Source : Un Import Ligne, Accélération du Fine-tuning de 3.7x

marsbitPublié le 2026-06-26Dernière mise à jour le 2026-06-26

Résumé

NVIDIA a open-sourcé NeMo AutoModel, une solution permettant d'accélérer jusqu'à 3,7 fois le réglage fin (fine-tuning) des grands modèles de type MoE (Mixture of Experts). Compatible avec l'API de Hugging Face Transformers v5, elle ne nécessite qu'une simple ligne d'importation pour obtenir ces gains de performances. Les expériences menées sur des modèles comme Qwen3-30B-A3B montrent une augmentation du débit d'entraînement de 3,4 à 3,7 fois et une réduction de 29% à 32% de la mémoire GPU utilisée. Cette optimisation repose sur trois technologies clés : le parallélisme d'experts (Expert Parallelism) pour répartir la charge mémoire, DeepEP pour fusionner calculs et communications, et TransformerEngine pour accélérer les opérations de base du Transformer. Ainsi, NeMo AutoModel offre une mise à niveau transparente pour les utilisateurs de Transformers v5, permettant un réglage fin plus rapide et plus efficace des modèles MoE à grande échelle sans modifications majeures du code. Le code et la documentation sont disponibles sur GitHub.

Un import d'une ligne, le fine-tuning de grands modèles MoE est accéléré de 3,7 fois.

Les derniers travaux de recherche de NVIDIA sont désormais open source : NeMo AutoModel, conçu spécifiquement pour la construction et le fine-tuning à grande échelle de modèles d'IA générative.

Construit sur la base de Hugging Face Transformers v5, NeMo AutoModel permet, sans modifier le code API, simplement en ajoutant une ligne d'import, de réaliser un fine-tuning plus rapide pour les modèles MoE.

Les expériences montrent que, par rapport à la version originale de Transformers v5 de Hugging Face, NeMo AutoModel de NVIDIA permet de réaliser un gain de débit de formation de 3,4 à 3,7 fois lors du fine-tuning MoE, et réduit de 29% à 32% l'utilisation de mémoire GPU.

Sur un seul nœud avec 8 GPU H100 80GB, prenant l'exemple de Qwen3-30B-A3B, NeMo AutoModel augmente directement le TPS/GPU (débit par seconde par GPU) de 3075 à 11340, soit une amélioration de 3,69 fois.

Analyse de la technologie clé

MoE est devenu l'architecture dominante des modèles de pointe actuels, mais MoE apporte également de nouveaux défis pour un entraînement efficace :

Parallélisme d'experts, fusion des communications, optimisation des kernels... Ces travaux d'ingénierie complexes nécessitent des infrastructures de support adaptées.

Transformers v5 de HuggingFace est actuellement la "base générique" de formation MoE la plus utilisée. La v5 améliore la prise en charge native de MoE, introduisant des capacités fondamentales comme les *expert backends*, le *dynamic weight loading* et l'exécution distribuée pour MoE.

Cette fois, l'approche de NVIDIA est de se placer sur les épaules de ses prédécesseurs, en restant compatible avec l'API de HuggingFace Transformers, permettant aux utilisateurs d'obtenir un débit de formation plus élevé et une consommation mémoire plus faible lors du fine-tuning MoE sans modifier largement leur code.

Plus précisément, NeMo AutoModel ajoute à Transformers v5 : Expert Parallelism (EP), DeepEP et TransformerEngine.

Expert Parallelism (Parallélisme d'Experts)

La technologie de parallélisme d'experts sert principalement à réduire la pression mémoire.

EP répartit les poids des experts sur plusieurs GPU, chaque GPU ne détenant plus la totalité des paramètres de tous les experts, mais seulement une partie.

Par exemple, sur 8 GPU avec ep_size=8, les poids des experts sont répartis sur les 8 GPU, l'empreinte mémoire MoE par GPU peut être réduite à 1/8 de l'original.

D'après les résultats expérimentaux, pour Qwen3, cette technologie peut réduire la mémoire maximale de 68,2 GiB à 48,1 GiB, soit une baisse de 29%.

Pour le modèle Nemotron Nanomo, l'utilisation mémoire passe de 62,1 GiB à 42,5 GiB, une baisse de 32%.

L'espace libéré peut être utilisé pour supporter des lots plus grands ou des séquences plus longues.

DeepEP

DeepEP réalise la fusion des calculs et des communications.

Dans l'approche traditionnelle, il y a un coût de communication significatif entre la distribution des tokens et le calcul des experts. DeepEP intègre les opérations de distribution et de combinaison des tokens dans des kernels GPU optimisés, permettant le chevauchement du processus de communication et du calcul des experts.

TransformerEngine

Le kernel TransformerEngine fournit une accélération pour divers calculs de base.

Cette technologie offre des implémentations fusionnées pour les mécanismes d'attention, les couches linéaires et RMSNorm, etc., accélérant non seulement la couche MoE mais aussi les couches Transformer ordinaires.

Un import d'une ligne, une amélioration de vitesse par 3

En résumé, pour ceux qui utilisent déjà Transformers v5, NeMo AutoModel de NVIDIA propose une solution de mise à niveau sans douleur :

Il suffit d'ajouter une ligne de code d'import pour obtenir une amélioration de vitesse de fine-tuning MoE par un facteur de 3.

Sur Qwen3-30B-A3B et Nemotron 3 Nano 30B-A3B, comparé à Transformers v5, cette solution permet d'atteindre une amélioration du débit de formation de 3,4 à 3,7 fois, tout en réduisant la consommation mémoire de 29% à 32%.

NVIDIA a également présenté les résultats du fine-tuning complet des paramètres pour Nemotron 3 Ultra 550B A55B sur 16 nœuds H100, soit 128 GPU.

Le TPS/GPU était de 815, le TFLOP/s/GPU environ 293, et la mémoire maximale de 58,2 GiB.

La raison pour laquelle il n'y a pas de comparaison avec la v5 ici est que Transformers v5 saturerait directement la mémoire à cette échelle ̄_(ツ)_/ ̄

Si vous êtes intéressés, NVIDIA a mis le code, les configurations et les scripts de benchmark sur GitHub : https://github.com/NVIDIA-NeMo/Automodel/tree/blog/transformers-v5-automodel/blog_experiments

Le guide d'utilisation détaillé se trouve ici : https://docs.nvidia.com/nemo/automodel/latest/get-started/hf-compatibility

Cet article provient du compte WeChat officiel "Quantum Bit", auteur : Yu Yang

Cryptos en tendance

Questions liées

QQuel est l'outil développé par NVIDIA pour accélérer le fine-tuning des modèles MoE, et quel gain de vitesse promet-il ?

ANVIDIA a développé NeMo AutoModel. Il promet d'accélérer le fine-tuning des modèles MoE jusqu'à 3,7 fois, tout en réduisant l'utilisation de mémoire GPU de 29% à 32%.

QSur quelle base NeMo AutoModel est-il construit et comment est-il intégré par les développeurs ?

ANeMo AutoModel est construit sur Hugging Face Transformers v5. Pour l'intégrer, les développeurs n'ont qu'à ajouter une seule ligne d'import dans leur code sans changer l'API existante.

QQuelle est la technologie clé utilisée pour réduire la pression mémoire, et comment fonctionne-t-elle ?

ALa technologie clé est le parallélisme d'experts (Expert Parallelism, EP). Elle répartit les poids des experts sur plusieurs GPU, de sorte que chaque GPU ne stocke qu'une fraction des paramètres, réduisant ainsi considérablement l'empreinte mémoire sur chaque carte.

QQuels sont les trois composants principaux ajoutés par NeMo AutoModel par rapport à Transformers v5 ?

ALes trois composants principaux ajoutés sont : le parallélisme d'experts (EP), DeepEP (qui fusionne le calcul et la communication), et TransformerEngine (qui fournit des noyaux optimisés pour les opérations fondamentales du Transformer).

QOù les développeurs peuvent-ils trouver le code, la configuration et les scripts de test de NeMo AutoModel ?

ALe code, la configuration et les scripts de benchmark sont disponibles sur le dépôt GitHub de NVIDIA NeMo AutoModel : https://github.com/NVIDIA-NeMo/Automodel/tree/blog/transformers-v5-automodel/blog_experiments. Le guide d'utilisation se trouve à l'adresse : https://docs.nvidia.com/nemo/automodel/latest/get-started/hf-compatibility.

Lectures associées

Une équipe de décoration improvise un 'chef-d'œuvre' abstrait « Niú Lái », le meme-coin du même nom multiplié par 3000 en 3 jours

L'équipe de rénovation derrière le film d'animation abstrait "Niu Lai" (牛来, signifiant "Le taureau arrive") a créé une sensation en ligne. Réalisé par une ancienne entreprise de décoration devenue studio d'animation, le film se distingue par son animation rudimentaire, son style visuel "abstrait" et son histoire simple sur un veau. Sorti le 5 août, il n'a initialement rapporté que 7 000 yuans en 9 jours, mais est devenu viral en raison de son esthétique unique et de ses propriétés mèmes. Le buzz en ligne a déclenché une ruée vers les salles de cinéma et une flambée des créations de mèmes et de contenu dérivé. Parallèlement, un jeton mème homonyme "Niu Lai" a été lancé le 14 août, connaissant une augmentation de près de 3000 fois de sa valorisation en seulement trois jours, atteignant presque 30 millions de dollars. Le phénomène est analysé comme un symbole culturel : une réaction contre l'industrie cinématographique mainstream, une représentation de l'espoir populaire pour un marché haussier ("bull market"), et une démonstration du pouvoir des mèmes dans l'économie de l'attention. Les autorités du film ont précisé que l'obtention du permis de diffusion ("dragon seal") se concentre sur la conformité du contenu, pas sur la qualité de production, permettant ainsi à des projets low-cost de voir le jour.

Odaily星球日报Il y a 23 mins

Une équipe de décoration improvise un 'chef-d'œuvre' abstrait « Niú Lái », le meme-coin du même nom multiplié par 3000 en 3 jours

Odaily星球日报Il y a 23 mins

2 000 milliards de dollars : le plus grand IPO de l’histoire de l’IA à l’approche

À deux mois de son introduction en bourse prévue en octobre, Anthropic s'apprête à réaliser ce qui pourrait être la plus grande IPO de l'histoire de l'IA, avec une valorisation potentielle de 2 000 milliards de dollars. Fondée il y a cinq ans par d'anciens membres clés d'OpenAI, la société a connu une croissance fulgurante : ses revenus annuels sont passés d'environ 9 milliards de dollars fin 2025 à 47 milliards en mai 2026, avec une multiplication par 14 de son chiffre d'affaires au deuxième trimestre 2026. Cette valorisation astronomique, calculée par des investisseurs sur la base de projections de revenus pour 2028 (estimés entre 190 et 200 milliards de dollars), repose largement sur le succès de Claude Code. Cette offre, qui représente près de 20% des revenus, domine le marché du codage assisté par IA avec environ 54% des dépenses, loin devant OpenAI. Cependant, des tensions internes menacent la cohésion de l'entreprise. Une culture managériale décrite comme dogmatique et "sectaire" par certains, portée par une direction se voyant comme les gardiens de l'IA sûre, crée un clivage avec des employés frustrés. Ces derniers sont tiraillés entre la perspective d'une richesse colossale grâce à l'IPO et un environnement de travail devenu toxique. Anthropic, dont le modèle économique dépend fortement des contrats API d'entreprise, se trouve à un carrefour. Pour poursuivre son ambition de développer une IA "sûre" et toujours plus puissante, elle a besoin d'énormes capitaux, ce qui l'oblige à répondre aux exigences de croissance frénétique des marchés. L'entreprise marche sur une corde raide, face à des défis comme la régulation, les coûts de calcul et ses divisions internes, alors qu'elle entre dans la dernière ligne droite avant une introduction historique qui scellera son destin.

marsbitIl y a 2 h

2 000 milliards de dollars : le plus grand IPO de l’histoire de l’IA à l’approche

marsbitIl y a 2 h

L'IA qui réduit les coûts et améliore l'efficacité rend le capital-risque de plus en plus coûteux

L'IA réduit les coûts de création d'entreprise mais rend l'investissement en capital-risque plus coûteux. Alors que les outils d'IA permettent à des startups de se lancer avec moins de capital et des équipes plus petites, le marché des investissements en phase amont devient de plus en plus cher. Les startups d'IA fondées par des talents d'élite (ex-Google, OpenAI) obtiennent des évaluations de plusieurs milliards de dollars dès le stade *seed*, réduisant la fenêtre pour investir à bas prix. Les données de Carta montrent une concentration des capitaux : les financements se polarisent entre de nombreux petits tours et quelques méga-tours pour des projets d'IA tête de série. Les évaluations médianes augmentent (24,3M$ en *seed*), tandis que la dilution des actions fondatrices diminue (environ 18% en *seed* et série A). Pour les VC, obtenir et maintenir une part significative dans les sociétés prometteuses nécessite donc des mises de fonds bien plus importantes. Conséquence : les grands fonds comme Accel lèvent des sommes records (85 milliards de dollars en quatre mois) pour pouvoir investir tôt et suivre dans les tours suivants face à la concurrence. La stratégie est de sécuriser une position dans les futurs gagnants potentiels de ce "super-cycle" technologique. Cependant, ce modèle mise sur une croissance future massive pour justifier les évaluations précoces extrêmes, concentrant les risques et les capitaux sur un petit nombre de projets.

marsbitIl y a 2 h

L'IA qui réduit les coûts et améliore l'efficacité rend le capital-risque de plus en plus coûteux

marsbitIl y a 2 h

Trading

Spot

Articles tendance

Comment acheter ONE

Bienvenue sur HTX.com ! Nous vous permettons d'acheter Harmony (ONE) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément Harmony (ONE).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos Harmony (ONE)Après avoir acheté vos Harmony (ONE), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des Harmony (ONE)Tradez facilement Harmony (ONE) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

658 vues totalesPublié le 2024.12.12Mis à jour le 2026.06.02

Comment acheter ONE

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de ONE (ONE) sont présentées ci-dessous.

活动图片