Un professeur de Stanford diffuse en direct l'entraînement d'un modèle de 535B paramètres : le « boîte noire » de l'entraînement des modèles est-elle en train de s'ouvrir ?

marsbitPublié le 2026-08-24Dernière mise à jour le 2026-08-24

Résumé

Le professeur Percy Liang de Stanford et son équipe ont lancé un entraînement public en direct du modèle Marin 535B-A23B, un modèle de langage massif avec 535 milliards de paramètres. L'ensemble du processus, d'une durée prévue de trois mois, est diffusé en temps réel via des plateformes comme Weights & Biases, permettant à quiconque d'observer la progression du modèle, les courbes de perte, les données d'entraînement et les défis techniques. Cette initiative vise à démystifier le "boîte noire" que constitue généralement l'entraînement des grands modèles comme GPT-4 ou Claude. En rendant transparents les détails des données, des hyperparamètres et des problèmes rencontrés, le projet Marin cherche à favoriser l'observation, la discussion et la collaboration ouverte au sein de la communauté. Avant ce "hero run", l'équipe a préalablement entraîné une série de modèles plus petits pour anticiper les problèmes et prédire le comportement du modèle principal. Les réactions en ligne saluent cette transparence, la qualifiant d'incarnation de l'esprit open source. Certains y voient même une opportunité d'apprentissage unique, permettant aux observateurs d'analyser et de comprendre les dynamiques spécifiques de l'entraînement, comme les variations des normes de paramètres. Percy Liang, qui enseigne également un cours sur la construction de modèles de langage depuis zéro, semble déterminé à partager les connaissances pratiques de ce domaine en pleine évolution.

Ces deux derniers jours, un post d'un internaute nommé Max For AI@MaxForAI sur X a suscité un vif débat : « C'est fou – vous pouvez maintenant assister en direct à la formation d'un énorme modèle de 535B paramètres. »

En réalité, Percy Liang@percyliang, professeur à Stanford et fondateur de Simile AI, a annoncé le démarrage de l'entraînement du modèle Marin 535B-A23B par le laboratoire ouvert Marin, et tout le processus d'entraînement sera entièrement public.

Marin dispose de 535 milliards de paramètres au total et de 23 milliards de paramètres activés. Pour cela, Percy Liang et son équipe ont préparé un total de 18,75 billions de tokens de données d'entraînement et déployé 11 systèmes GB200 NVL72, soit environ 792 GPU GB200.

Le modèle devrait être entraîné en continu pendant environ 3 mois, avec un total de calculs d'entraînement d'environ 2,7e24 FLOPs. Une fois l'entraînement terminé, l'équipe poursuivra également la phase de post-formation (post-training).

Autrement dit : Au cours des prochains mois, tout le monde pourra observer comment un modèle d'IA de pointe se développe à partir de zéro.

Il est également intéressant de noter que Percy Liang a indiqué qu'avant de lancer officiellement cette session d'entraînement, l'équipe avait déjà entraîné une série d'échelons de mise à l'échelle (Scaling Ladder) en 4 étapes, allant de 1,6B-A61M (48B tokens) jusqu'à 27,7B-A1,2B (926B tokens).

« Cela a deux objectifs, premièrement, utiliser ces expériences à petite échelle pour détecter et déboguer rapidement les problèmes potentiels ; deuxièmement, baser les prévisions pour notre « entraînement principal » (hero run) sur les performances des modèles à différentes échelles. »

Bien sûr, Percy Liang a également déclaré : « C'est l'entraînement le plus important que nous ayons jamais réalisé, donc nous nous attendons effectivement à rencontrer des imprévus pendant le processus. »

Actuellement, le modèle principal a officiellement commencé son exécution, et tout le monde peut consulter directement les courbes d'entraînement en temps réel. Par la suite, les données d'entraînement, les journaux d'expérimentation et les problèmes techniques continueront d'être rendus publics.

Par exemple, au niveau des données, cela inclut les proportions de mélange des données d'entraînement, les méthodes de traitement des données, et comment les données de différents domaines sont introduites dans le modèle ; au niveau technique, cela inclut la configuration de l'entraînement, le code et la conception des expériences ; le processus d'entraînement, y compris les changements de perte (loss) en temps réel, l'état du modèle et les résultats prédictifs à différentes étapes.

Simultanément, Percy Liang a également rendu publics les canaux spécifiques pour suivre l'entraînement.

Consultez la composition des données : https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

Suivez le processus d'entraînement en temps réel sur Weights & Biases (wandb) : https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Consultez tous les détails sur GitHub : https://github.com/marin-community/marin/issues/8435

Après une analyse plus approfondie, il est facile de comprendre pourquoi cette initiative de Percy Liang a suscité autant d'attention. Parce que par le passé, pour des modèles comme GPT-4, Claude, Gemini, etc., on ne savait absolument pas comment ils étaient entraînés en détail, c'était comme une « boîte noire ».

On ne pouvait voir que les capacités finales du modèle, les scores sur des benchmarks, quelques descriptions dans des articles scientifiques, etc. Quant aux proportions de données, les échecs d'entraînement, les hyperparamètres efficaces, l'évolution de la perte, la précision des lois d'échelle (Scaling law), tout cela était inconnu.

Marin cherche à changer cela. Peut-être que l'entraînement des modèles peut également devenir comme les articles scientifiques ou les logiciels open source : observable, discutable, collaboratif.

Depuis l'annonce de cette nouvelle, l'enthousiasme des internautes ne cesse de croître.

Certains internautes estiment que c'est là le véritable esprit open source, « même si des problèmes surviennent pendant l'entraînement ou que les résultats s'écartent des attentes, rien n'est caché. »

D'autres internautes soulignent que, même si le modèle d'entraînement lui-même est déjà énorme, ce qui est vraiment impressionnant, c'est que tout le monde peut maintenant suivre en temps réel sur la plateforme WandB le processus de croissance étape par étape d'un grand modèle d'entraînement dont la valeur équivaut à des milliards de dollars ?

« C'est comme si la pièce sombre et fermée à clé d'un laboratoire d'IA de premier plan s'ouvrait soudainement, permettant à tout le monde de voir ce qui s'y passe. »

Au cours des trois prochains mois, ce qui est peut-être le plus attendu n'est pas les capacités finales du modèle, mais plutôt d'observer combien de fois ce modèle va « exploser », s'effondrer ou rencontrer des situations inattendues pendant son entraînement...

De plus, certains internautes pensent que cette initiative ne fournit pas seulement une perspective pour observer l'intégralité du processus d'entraînement d'un modèle, mais offre même une plateforme d'apprentissage et d'échanges.

L'internaute James Thewlis@jdthewlis a suivi le processus d'entraînement en temps réel. Pendant ce suivi, il ne comprenait pas « pourquoi, aux alentours de l'étape 500, les normes (paramètres de norme) présentaient un pic ? »

Après avoir trouvé la réponse par lui-même, il s'est répondu dans les commentaires : « Ce pic est entièrement dû au biais de routeur (router_bias). Ce n'est pas un paramètre appris par le biais du gradient, mais fait partie du mécanisme d'équilibrage des tokens (token balancing heuristic) dans le modèle MoE (Mixture of Experts), donc il a une dynamique différente de celle des paramètres ordinaires du modèle. »

Il existe de nombreux cas similaires.

Par ailleurs, il est intéressant de mentionner qu'en plus de cette mise en pratique concrète, Percy Liang, en tant que professeur à Stanford, donne également un cours théorique : « CS336: Language Models From Scratch » (Modèles de langage à partir de zéro), dont l'objectif est que les étudiants comprennent pleinement comment un grand modèle de langage est construit.

Il semble que Percy Liang veuille vraiment apprendre à tout le monde à « construire » de grands modèles. Les internautes intéressés peuvent en savoir plus.

Lien vers le cours : https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Et vous ? Que pensez-vous de cette diffusion en direct qui met véritablement l'entraînement des grands modèles sur le devant de la scène ? N'hésitez pas à laisser vos commentaires !

Liens de référence :

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Attention à l'IA

Questions liées

QQui est à l'origine de l'entraînement en direct du modèle de langage massif de 535 milliards de paramètres et quelle est son affiliation ?

APercy Liang, professeur à l'Université de Stanford et fondateur de Simile AI, est à l'origine de ce projet d'entraînement public, mené par le laboratoire ouvert Marin.

QQuelles sont les ressources de calcul principales utilisées pour entraîner le modèle Marin 535B-A23B ?

ALe projet utilise 11 systèmes GB200 NVL72, ce qui équivaut à environ 792 GPU GB200, pour réaliser l'entraînement.

QQuelle est la durée prévue pour la phase principale d'entraînement du modèle ?

ALa phase principale d'entraînement du modèle devrait durer environ trois mois.

QQuel est l'objectif principal du projet d'entraînement public mené par Percy Liang et le laboratoire Marin selon l'article ?

AL'objectif principal est de rendre le processus d'entraînement des grands modèles de langage observable, discutable et collaboratif, en ouvrant ce qui était traditionnellement un 'boîte noire'.

QOù le public peut-il suivre en temps réel la progression de l'entraînement du modèle ?

ALe public peut suivre l'entraînement en temps réel sur la plateforme Weights & Biases (wandb) via le lien fourni : https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Lectures associées

Meilleure cryptomonnaie mème à acheter en 2026 : MemeToro réunit les agents IA et l'infrastructure de la BNB Chain

La recherche de la meilleure memecoin à acheter en 2026 s'oriente vers les projets dotés d'infrastructures pratiques. MemeToro se distingue en combinant des agents IA et l'infrastructure BNB Chain. Son objectif est de créer un écosystème où l'intelligence artificielle facilite la découverte, la validation et le lancement de nouveaux memecoins. Le choix de BNB Chain est stratégique, car ses faibles coûts de transaction et sa rapidité conviennent aux lancements fréquents et au trading de détail. MemeToro développe une plateforme de lancement (launchpad) alimentée par l'IA, conçue spécifiquement pour la création et la découverte de memecoins. Les agents autonomes de MemeToro constituent son principal atout. Ils surveillent les tendances émergentes pour identifier les opportunités et valident les contrats intelligents pour signaler les mécanismes suspects, ajoutant une couche de sécurité aux nouveaux lancements sur BNB Chain. Contrairement aux memecoins comme DOGE, SHIB ou PENGU, qui reposent sur la notoriété, l'utilité ou la propriété intellectuelle, MemeToro se positionne comme une infrastructure. Son modèle pourrait bénéficier de la croissance de l'ensemble du secteur des memecoins, en soutenant la nouvelle génération de lancements grâce à l'IA, plutôt que de dépendre uniquement de son propre succès viral. Le projet en est actuellement à l'étape 6 de sa prévente.

bitcoinistIl y a 1 mins

Meilleure cryptomonnaie mème à acheter en 2026 : MemeToro réunit les agents IA et l'infrastructure de la BNB Chain

bitcoinistIl y a 1 mins

La Valeur des Actifs Tokenisés sur Avalanche Dépasse les 3 Milliards de Dollars Alors que la Poussée des RWA S’accélère

La valeur des actifs réels tokenisés (RWA) sur Avalanche a franchi le seuil de 3 milliards de dollars, marquant une étape importante dans le développement de la blockchain en tant qu'infrastructure pour la finance institutionnelle et réglementée. Cette somme agrégée résulte principalement de la migration de titres de 1,2 milliard de dollars par Progmat, ainsi que des contributions d'OpenTrade (environ 190 millions) et de Grove Finance (environ 260 millions). Les RWA, qui représentent des actifs traditionnels comme des titres du Trésor ou des produits de crédit sur la blockchain, constituent un cas d'usage institutionnel crédible pour la cryptographie. Ce cap de 3 milliards renforce le récit d'Avalanche comme une plateforme conçue pour les déploiements institutionnels, grâce à ses sous-réseaux personnalisables adaptés aux besoins de conformité. L'importance de cette étape ne doit pas être réduite à un impact sur le prix du token AVAX. Il s'agit avant tout d'une mesure d'adoption du réseau. L'enjeu futur pour Avalanche sera de transformer cette valeur tokenisée en une infrastructure financière active, avec des actifs effectivement négociés, utilisés comme collatéral ou intégrés dans la DeFi. Ce seuil place néanmoins Avalanche en bonne position dans la course à la tokenisation institutionnelle, un secteur de croissance majeur.

bitcoinistIl y a 11 mins

La Valeur des Actifs Tokenisés sur Avalanche Dépasse les 3 Milliards de Dollars Alors que la Poussée des RWA S’accélère

bitcoinistIl y a 11 mins

La concentration de la dette d'Aave soulève des questions de risque après la volatilité d'Ethereum

Le profil de dette d’Aave attire l’attention après qu’une évaluation des risques a révélé que moins de 9 % des positions de prêt représentent environ la moitié de la dette totale impayée du protocole. Cette concentration est largement liée aux utilisateurs du mode E qui exécutent des positions levier, impliquant des emprunts de WETH adossés à des jetons de staking liquide. La récente volatilité d’Ethereum a remis cette structure en lumière, car les trades corrélés de type « boucle de staking » peuvent devenir vulnérables lorsque les conditions de marché évoluent rapidement. Il ne s’agit pas d’une preuve d’insolvabilité d’Aave ou d’une cascade de liquidations en cours. L’enjeu est plus spécifique : la concentration de la dette et le risque de corrélation peuvent rendre certaines parties d’un protocole de prêt plus sensibles aux mouvements brusques du cours de l’ETH. Le mode E d’Aave, conçu pour les actifs corrélés, accroît l’efficacité du borrowing mais peut aussi amplifier le levier et la fragilité en période de stress. En cas de mouvement baissier rapide d’Ethereum, de nombreuses positions utilisant des collatéraux similaires pourraient être soumises à des liquidations simultanées, accentuant la pression de vente et les tensions de liquidité. Aave, protocole de prêt décentralisé, gère ses risques via des paramètres de collatéral, de liquidation et d’oracles, mais une dette concentrée peut rendre les événements de stress plus non linéaires. La question suivante est de savoir si la gouvernance d’Aave ajustera des paramètres tels que les facteurs de collatéral ou les seuils de liquidation. Pour l’instant, le signal n’est pas la panique, mais la prudence : la concentration du levier lié à l’ETH dans un marché majeur comme Aave reste un risque à surveiller, susceptible d’affecter la liquidité de tout l’écosystème Ethereum.

bitcoinistIl y a 17 mins

La concentration de la dette d'Aave soulève des questions de risque après la volatilité d'Ethereum

bitcoinistIl y a 17 mins

Pharos introduit le crédit obligataire institutionnel sur chaîne, l'écosystème RealFi s'élargit avec de nouveaux actifs

Pharos Network a lancé le pRNH Vault, un produit permettant aux utilisateurs éligibles d'investir sur la chaîne dans des obligations d'entreprises américaines à haut rendement. Cette initiative élargit son marché RealFi (finance du monde réel) au-delà des stablecoins et des produits monétaires tokenisés pour inclure des actifs de crédit d'entreprise. Le vault pRNH est adossé au portefeuille NYLIM Anemoy US High Yield Corporate Bond (HYB), tokenisé par Centrifuge. Les utilisateurs déposent de l'USDC sur Pharos pour obtenir des jetons pRNH, représentant une exposition à un fonds obligataire à haut rendement géré activement par NYLIM, visant un rendement annualisé cible d'environ 7%. Pharos considère que la tokenisation n'est qu'une première étape. La vraie valeur réside dans la création d'un marché où les actifs institutionnels peuvent être découverts, évalués et utilisés de manière programmable. La structure pRNH intègre des fonctionnalités d'assistance par agents intelligents pour la sélection du crédit, la surveillance de la liquidité et les opérations sur chaîne. Pour soutenir cela, Pharos utilise une pile technologique incluant le moteur SALI, un réseau de traitement modulaire (SPN), un cadre de conformité, des mécanismes ZK-KYC/AML, et la prise en charge native des agents IA. Le réseau se positionne comme la « couche de découverte de valeur » pour une économie d'agents, où la valeur réelle, les agents intelligents et les actifs institutionnels sont accessibles. Le lancement de pRNH valide ce modèle en injectant du crédit d'entreprise institutionnel dans son écosystème.

marsbitIl y a 26 mins

Pharos introduit le crédit obligataire institutionnel sur chaîne, l'écosystème RealFi s'élargit avec de nouveaux actifs

marsbitIl y a 26 mins

Trading

Spot
活动图片