Explosif.
Il y a quelques instants, NVIDIA a dévoilé pour la première fois de son histoire les premiers résultats de test sur puce de son prochain rack phare, le Vera Rubin NVL72.
Et ce test a directement mis à contribution DeepSeek-V4-Pro, exécutant la tâche réelle d’« agent de codage » !
Le résultat est stupéfiant : comparé au GB300 NVL72, le roi actuel, le Vera Rubin affiche un débit par mégawatt jusqu’à 30 fois supérieur, et le coût par token a chuté jusqu’à 35 fois !

Certains s’exclament : « Je n’oserais même pas écrire ça dans un PowerPoint pour séduire des investisseurs ! »
Un internaute a commenté avec humour : « Avant, on trouvait la H200 à 30 000 dollars la carte chère, mais maintenant, en y repensant, la H200 n’est même plus considérée comme une version d’entrée de gamme. »

Analysons cela en détail.
De la H200 au GB300, le débit pour les charges de travail réelles d'agent a été multiplié jusqu'à 30 fois, pour un coût global qui a à peu près doublé.
Du GB300 au Vera Rubin, le débit a de nouveau été multiplié jusqu'à 30 fois, et le prix du rack complet a à nouveau à peu près doublé.
Selon la loi de Moore de Jensen Huang, il semble que la plus grande avancée technologique de NVIDIA ces deux dernières années ne soit pas la puce GPU elle-même, mais d'avoir rendu le prix 4 fois plus élevé, en échange d'une augmentation de vitesse vertigineuse de 900 fois !

Aujourd'hui, NVIDIA a annoncé à tous une vérité contre-intuitive : l'ère des LLM est terminée, l'ère des Agents est arrivée, et tous les anciens benchmarks IA sont désormais obsolètes !

Parallèlement, le Vera CPU, conçu spécifiquement pour les agents, a été installé en urgence par SpaceXAI d'Elon Musk, avec même l'intention de l'envoyer directement dans l'espace.
Le même jour, NVIDIA a également lancé la production en série du Groq 3 LPX.
Gemma 4 31B y tourne à une vitesse absolument folle, atteignant directement 3400 tokens par seconde. Le débit des modèles à milliers de milliards de paramètres a été multiplié par 35.


Ces nouveaux records réécrivent dès ce soir le paysage commercial de l'écosystème des Agents !
Pourquoi NVIDIA devait-il lancer Vera Rubin ?
Les dernières données d'OpenRouter donnent la réponse : dans le monde réel, une tâche d'Agent IA consomme 15 fois plus de tokens qu'une conversation de chat ordinaire !
Par exemple, si on demande à un Agent d'étudier une entreprise pour une décision d'investissement, pendant ce processus, l'agent et ses sous-agents raisonnent constamment, les tokens accumulés devenant l'entrée pour l'étape suivante. Le traitement du contexte long devient alors l'élément le plus limitant pour l'IA agentique.

Plus les interactions de l'agent sont nombreuses, plus le débit est élevé — le nombre d'agents a été multiplié par 10, les appels d'outils par 2, et les contradictions entre puissance de calcul et algorithmes ont généré de nouveaux besoins.

Ne confondez pas le chat avec un Agent, les anciens benchmarks sont obsolètes !
À ce stade, les tests de référence IA traditionnels (comme les tests de séquences fixes de 8K/1K) deviennent complètement inefficaces.
NVIDIA l'affirme clairement : les mesures de performances doivent évoluer ! On ne peut plus tester une simple requête de raisonnement, il faut capturer le flux de travail complet d'un Agent.
Pour cela, ils ont utilisé le test de référence AgentX de SemiAnalysis.
Ce test n'est plus un simple Q&R rigide, mais la relecture de « sessions de codage » réelles, avec croissance de contexte, appels d'outils et génération de sous-agents.

C'est pourquoi la H200 semble dépassée sur le nouveau champ de bataille des Agents, et pourquoi le Vera Rubin est destiné à régner.
Vera Rubin NVL72 × DeepSeek-V4-Pro :
Le monstre de calcul est arrivé
Pour prouver la puissance du Vera Rubin NVL72, NVIDIA a directement utilisé le champion open source, DeepSeek-V4-Pro (1.6T), pour des tests sur puce.
Les données sont sorties, et le résultat est stupéfiant —
Sous la charge de travail AgentX, le débit par mégawatt du Vera Rubin NVL72 est jusqu'à 30 fois supérieur à celui du GB300 NVL72 !

Notez bien que la comparaison ne se fait pas avec l'ancienne H200, mais avec le GB300, la star actuelle.
Dans le même test DeepSeek-V4-Pro, le débit par mégawatt du GB300 était déjà 15 fois supérieur à celui de la H200.
Pourtant, le Vera Rubin a encore multiplié par 30 les performances du GB300, repoussant encore la frontière de la courbe de Pareto !
Qu'est-ce que cela signifie ?
Pour les « usines IA » limitées par l'approvisionnement en électricité, cela repousse directement les limites des lois physiques.
Avec le même budget électrique, le Vera Rubin peut accomplir 30 fois plus de travail d'agent.
Pour les centres de données de niveau mégawatt voire gigawatt, c'est comme disposer soudainement de 30 fois plus d'actifs de calcul.
De plus, la technologie NVIDIA DSX MaxLPS permet une gestion de l'alimentation au niveau du GPU, du rack et de la charge de travail, permettant de configurer jusqu'à 40 % de GPU supplémentaires dans le même budget mégawatt, améliorant encore le débit par mégawatt des usines IA !

Coût par token divisé par 35 ! Le « livre de comptes » de l'industrie des Agents est réécrit
Le débit par mégawatt impacte directement le coût de génération de chaque token. L'explosion des performances a pour conséquence la plus directe une explosion nucléaire des modèles commerciaux.
NVIDIA annonce que le coût de production par million de tokens du Vera Rubin NVL72 est jusqu'à 35 fois inférieur à celui du GB300 NVL72 !

Lorsque le coût du raisonnement chute de façon vertigineuse de 35 fois, les employés numériques fonctionnant 24h/24 deviendront réalité, et les super-applications grand public connaîtront une explosion.
Le coup de couteau de Jensen Huang ouvre directement la porte de l'ère des applications Agents.

Conception collaborative extrême : comment Jensen Huang y est-il parvenu ?
Vous vous demandez peut-être : comment une amélioration de 30 fois est-elle possible ? Est-ce dû au procédé d'une seule puce ?
Clairement non.
L'incroyable amélioration des performances du Vera Rubin NVL72 repose sur la « conception collaborative extrême ».

Par exemple, les services séparés, le cache KV distribué, le routage sensible au KV, MegaMoE, etc.

De plus, la quantification NVFP4 compresse directement les poids du modèle en précision 4 bits, réduisant considérablement l'occupation mémoire sans sacrifier la qualité de sortie, faisant décoller le débit.
Et la sixième génération de NVLink avec les grands modèles MoE fournit un réseau d'interconnexion 10 fois plus rapide et avec une latence 3 fois plus faible que l'Ethernet standard, permettant à des modèles massifs comme DeepSeek, basés sur l'architecture MoE, d'appeler fluidement différents sous-réseaux « experts » entre 72 GPU.
Ce n'est plus la vente d'une carte graphique, Jensen Huang vend une centrale électrique IA complète.

Le NVIDIA Groq 3 LPX est produit en série :
3400 Token/seconde, les Agents de code sont bouleversés !
Lors de la conférence Hot Chips 2026, NVIDIA a également annoncé une nouvelle fracassante : la production en série du Groq 3 LPX a commencé !

Le Groq 3 LPX est une extension exclusive de la plateforme de centre de données Vera Rubin NVL72.
Il est « sur mesure » pour ce système, axé sur l'accélération du raisonnement à faible latence.
Cette technologie de pointe a été acquise par NVIDIA en décembre dernier pour 20 milliards de dollars auprès de la startup Groq.

Les agents IA rencontrent un problème de latence de décodage. Pour mettre fin à ce point sensible, le Groq 3 LPX sépare habilement le traitement massif du contexte de la génération de tokens.
La solution de NVIDIA est de laisser le GPU Rubin gérer le contexte à grande échelle et de confier la tâche de génération ultra-rapide de tokens au Groq 3 LPX.
L'un s'occupe de « lire », l'autre de « écrire », chacun faisant ce qu'il fait de mieux.

Dans un déploiement complet au niveau rack, jusqu'à 256 accélérateurs LP30 peuvent opérer en synergie avec les GPU via des interconnexions à très haut débit, formant un moteur de raisonnement à l'échelle de l'entreprise.

Ainsi, le Groq 3 LPX atteint directement des vitesses de sortie record.
Dans le test de référence d'Artificial Analysis, le Groq 3 LPX exécute Gemma 4 31B avec une fenêtre de contexte ultra-longue de 100 000 tokens, atteignant une vitesse de sortie stupéfiante de 3 400 tokens/seconde !
Cela le rend 4 fois plus rapide en réponse que ses concurrents pour les charges de travail extrêmement sensibles à la latence.

Les tâches d'agents en plusieurs étapes qui prenaient auparavant des heures peuvent maintenant être accomplies en quelques minutes !

Le temps nécessaire au Groq 3 LPX pour générer 5000 tokens est passé de 50 secondes à 1,5 seconde, soit un écart de 34 fois.

De plus, dans les tâches de codage, la vitesse de sortie maximale du Groq 3 LPX atteint 6981 tokens/s.

Jensen Huang a déclaré que grâce à la poussée du LPX pour la génération ultra-rapide de tokens, NVIDIA a réalisé « un autre bond en avant énorme » en termes de débit IA et de capacité de réponse.

Nebius a déjà déployé cette puce dans sa Nebius Token Factory, offrant une expérience ultime de réponse instantanée à chaque étape du cycle de l'agent.

Suivi de près, il y a Groq lui-même.

Lancement du premier CPU dédié aux Agents,
Elon Musk l'envoie « dans l'espace » en urgence !
Dans cette annonce, le coup le plus ambitieux est sans doute le Vera CPU.
Pour les Agents, NVIDIA a spécifiquement créé un CPU.
Le CPU Vera est conçu spécifiquement pour alimenter les agents intelligents.
Il est équipé de 88 cœurs Olympus conçus en interne, d'une mémoire LPDDR5X à haut débit, avec une bande passante atteignant directement 1,2 To/s.

Pourquoi l'ère des grands modèles nécessite-t-elle un tout nouveau CPU ?
Sur scène à Hot Chips, le responsable du CPU Vera de NVIDIA a déclaré : « L'IA agentique est la tâche de calcul la plus complexe de l'histoire ».

Pour une seule tâche, un agent doit exécuter des centaines d'étapes en arrière-plan : appeler des outils, exécuter du code Python, parcourir le contexte, traiter des masses de données...
Tout ce travail de coordination et d'exécution repose entièrement sur les épaules du CPU. C'est pourquoi NVIDIA a dû créer un CPU spécifique pour les Agents.
C'est précisément pour cette raison que SpaceXAI d'Elon Musk a annoncé en urgence le déploiement à grande échelle du CPU Vera de NVIDIA !
Dès mai dernier, NVIDIA avait discrètement envoyé les premiers échantillons du Vera à A社, OpenAI et SpaceXAI pour « tester les eaux ».
Seulement 3 mois plus tard, SpaceXAI s'est empressé de passer au déploiement complet.
Plus fou encore, SpaceXAI construit actuellement une usine de calcul de niveau gigawatt basée sur la plateforme Vera Rubin pour alimenter Grok.
De plus, cette puissance de calcul sera directement envoyée dans l'espace.
Elon Musk a déclaré : « Les deux entreprises, fortes de leurs atouts, ont conçu une version optimisée du Vera Rubin NVL72, qui sera déployée à grande échelle en 2028 ».

La première génération de satellites IA « Starmind » de SpaceXAI prévoit d'utiliser le système au niveau rack Vera Rubin NVL72.

D'une puce GPU à une usine d'Agents complète
Le même jour, deux puces majeures, le Vera CPU et le Groq 3 LPX, sont entrées en production de masse.
Cela revêt une grande importance pour NVIDIA.

À l'ère des grands modèles, NVIDIA a dominé l'entraînement et le raisonnement grâce aux GPU.
À l'ère des Agents, son territoire s'étend désormais aux CPU, aux accélérateurs de raisonnement, au NVLink, etc.
Ce que vend Jensen Huang n'est plus seulement un GPU.
Il veut vendre une usine IA capable de produire des tokens en continu.
Cette fois, Jensen Huang vise à refondre entièrement les bases de toute l'« ère des Agents ».
Références :
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Cet article provient du compte public WeChat « New Zhi Yuan », auteur : ASI Apocalypse





