# Inférence Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Inférence", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

NVIDIA dévoile le premier test choc de Vera Rubin : le débit de DeepSeek bondit de 30x

NVIDIA a dévoilé les premières mesures en silicium de son futur système phare Vera Rubin NVL72, testé avec le modèle DeepSeek-V4-Pro sur une charge de travail réelle d'agent de codage. Les résultats sont spectaculaires : par rapport au GB300 NVL72 actuel, le débit par mégawatt a bondi jusqu'à 30 fois, et le coût par token a chuté jusqu'à 35 fois. Ce bond en avant est rendu possible par une conception système extrême, intégrant la 6e génération NVLink, la quantification NVFP4 et des techniques comme le cache KV distribué. NVIDIA a également annoncé la production en masse de l'accélérateur Groq 3 LPX, une extension de la plateforme Vera Rubin spécialisée dans la génération à très faible latence. Il atteint une vitesse de 3 400 tokens/seconde sur Gemma 4 31B, réduisant radicalement le temps des tâches d'agent multi-étapes. Enfin, NVIDIA a présenté le Vera CPU, un processeur conçu spécifiquement pour les charges complexes des agents IA, avec 88 cœurs maison et une bande passante mémoire de 1,2 To/s. SpaceXAI a déjà commencé son déploiement, avec des projets d'intégration dans des satellites. Avec ces annonces, NVIDIA ne vend plus seulement des GPU, mais propose une "usine à IA" complète et optimisée pour l'ère des agents, repoussant les limites de la performance énergétique et réécrivant l'économie du secteur.

marsbitIl y a 9 h

NVIDIA dévoile le premier test choc de Vera Rubin : le débit de DeepSeek bondit de 30x

marsbitIl y a 9 h

Arthur Hayes fait un retour en force, Flop Labs veut devenir le "carburant" de l'économie des agents

Arthur Hayes, cofondateur de BitMEX, annonce son retour à la tête d'un nouveau projet, Flop Labs. Ce projet se présente comme un réseau monétaire natif pour l'économie des agents IA, visant à devenir le "carburant" (food for your AI agent) de cette économie émergente. Son concept central est le "Proof-of-Useful-Inference", un mécanisme de consensus qui remplacerait les calculs inutiles du minage par des tâches d'inférence IA utiles, récompensant ainsi les mineurs en FLOP, le jeton natif. Le réseau implique quatre rôles principaux : les Mineurs (fournissant la puissance de calcul GPU), les Validateurs (couche de confiance), les Agents IA (utilisateurs payant en FLOP pour les services) et les KOL/Partners communautaires. Le jeton FLOP sera lancé via un "Fair Launch" sans vente privée ni VC, avec un airdrop massif prévu au Q4 2026 et le bloc genèse au Q1 2027. Pour l'instant, la seule façon de prétendre à l'airdrop est de postuler pour l'un des rôles via les formulaires officiels. Bien que le projet suscite l'enthousiasme pour son airdrop et son récit, il est encore à un stade très précoce. Il manque actuellement un livre blanc détaillé, des spécifications techniques complètes sur le consensus, et des audits. La réussite de Flop Labs dépendra de sa capacité à fournir des avancées techniques concrètes et à construire un écosystème où les agents IA adopteront réellement le FLOP comme monnaie.

Odaily星球日报08/19 05:54

Arthur Hayes fait un retour en force, Flop Labs veut devenir le "carburant" de l'économie des agents

Odaily星球日报08/19 05:54

Miner, c'est raisonner. Comment Nockchain réalise-t-il un double revenu ?

CPI modéré : Les marchés actions surperforment toujours le crypto. Les flux ETF Bitcoin montrent une légère reprise, mais la tendance reste fragile. Nockchain, une blockchain de couche 1 lancée équitablement en mai 2025, active sa mise à niveau Logos. Son innovation centrale est la preuve de travail à connaissance zéro (ZKPoW), où le minage produit des preuves cryptographiques utiles plutôt que des hachages inutiles. La mise à jour Logos ajoute un second « puzzle » de minage : la multiplication de matrices entières, cœur des calculs d'inférence d'IA. Le réseau alloue désormais 30% de la production de blocs à ce puzzle IA et 70% au ZK-PoW. Ainsi, les mineurs peuvent potentiellement utiliser le même calcul pour sécuriser le réseau et servir un client payant, créant un double revenu. La sécurité du réseau est conçue pour croître avec la demande en inférence IA. Cependant, ce modèle dépend de l'existence d'une demande réelle et payante. Pour lancer cet écosystème, la société National Compute, liée aux fondateurs, servira de premier client ancré. Le déploiement, reporté à trois reprises, suit des audits et un programme de primes aux bogues. Des vulnérabilités antérieures rappellent que le mécanisme de preuve est encore jeune. La capitalisation de $NOCK est d'environ 22 millions de dollars. Le défi principal n'est plus technique : Nockchain a besoin qu'un marché viable pour l'inférence IA payante émerge pour que son modèle « sécurité + revenus » génère des flux de trésorerie réels et justifie sa proposition de valeur.

marsbit08/17 10:46

Miner, c'est raisonner. Comment Nockchain réalise-t-il un double revenu ?

marsbit08/17 10:46

Du jour au lendemain, GPT-5.6 Sol a été accéléré 14 fois par OpenAI

OpenAI, en partenariat avec Cerebras, a dévoilé en préversion un nouveau mode « Ultrafast » pour son modèle phare GPT-5.6 Sol. Ce mode permet d'atteindre une vitesse de génération allant jusqu'à 750 tokens par seconde, soit une accélération d'un facteur 14 par rapport au mode standard, sans perte de qualité. Il surpasse ainsi largement les performances de modèles concurrents comme Claude Fable 5 ou Opus 4.8. Cette avancée repose sur l'architecture matérielle révolutionnaire de Cerebras, utilisant des puces de la taille d'une tranche de silicium (WSE-3). Elles évitent les goulots d'étranglement de la mémoire des GPU traditionnels en conservant les paramètres du modèle dans une mémoire SRAM ultra-rapide intégrée. Lors du test exigeant « Humanity's Last Exam », GPT-5.6 Sol en mode Ultrafast a répondu à 2500 questions complexes en seulement 11 heures, contre plus de 78 heures pour un modèle rival. Cette vitesse ouvre la voie à de nouvelles applications en temps réel : réponse aux incidents techniques, analyse financière instantanée, support client avancé ou recherche interactive accélérée. Le mode Ultrafast est d'abord disponible en préversion limitée via l'API OpenAI, promettant de transformer les flux de travail nécessitant des raisonnements complexes et des appels en chaîne d'outils, en réduisant des processus de plusieurs heures à quelques minutes.

marsbit08/14 00:05

Du jour au lendemain, GPT-5.6 Sol a été accéléré 14 fois par OpenAI

marsbit08/14 00:05

Cerebras plonge en Bourse ! Les revenus matériels baissent de manière inattendue, le 'défi lancé à Nvidia' confronté à des fluctuations de la demande

Le fabricant de puces d'IA Cerebras a publié des résultats mitigés pour le Q2 2026. Si le chiffre d'affaires global a progressé de 74% à 180,1 millions de dollars (GAAP), une baisse inattendue de 23% des ventes matérielles (à 54,1 M$) a inquiété les marchés. Cette volatilité met en lumière les défis de sa stratégie de concurrence frontale avec Nvidia dans le matériel. Le véritable moteur de croissance est désormais le cloud. Les revenus des services cloud et autres ont bondi de 281% pour atteindre 126 millions de dollars, dépassant le matériel comme principale source de revenus. Cette transition vers un modèle "double" (matériel et services) est portée par la demande croissante en calcul d'inférence d'IA, avec des clients comme OpenAI. Malgré la déception sur le matériel, les perspectives sont solides. Les prévisions pour le Q3 et l'année 2026 (CA cœur jusqu'à 8,9 milliards de dollars) dépassent les attentes des analystes. La société dispose d'un carnet de commandes gigantesque de 254 milliards de dollars et augmente massivement ses capacités de production et de data centers. Cerebras mise sur son architecture de puce à l'échelle de la plaquette (WSE) pour l'inférence, évitant ainsi les pénuries de composants critiques comme le HBM. Cependant, la réaction du marché (chute de 17% en after-hours) montre que les investisseurs s'interrogent sur la pérennité de sa croissance matérielle, malgré des perspectives cloud robustes et une trésorerie abondante.

marsbit08/13 14:26

Cerebras plonge en Bourse ! Les revenus matériels baissent de manière inattendue, le 'défi lancé à Nvidia' confronté à des fluctuations de la demande

marsbit08/13 14:26

AMD acquiert Taalas : l'IA matérielle se passe de la mémoire HBM, composant en pénurie

AMD acquiert la start-up canadienne Taalas, qui a développé une technologie de puces d'IA spécialisées pour l'inférence. Ces puces éliminent le besoin de mémoire HBM, un composant critique et rare actuellement, en intégrant directement les poids d'un modèle de réseau neuronal dans les transistors du silicium. Cette approche permet des vitesses d'inférence considérablement plus rapides, mais au prix d'une flexibilité nulle : chaque puce est dédiée à une seule et unique modèle. Le premier prototype, gravé en 6nm, atteint des performances très élevées sur le modèle Llama 3.1 8B. AMD prévoit d'intégrer ces accélérateurs dans ses serveurs, en complément de ses GPU Instinct. L'acquisition par AMD met en lumière une tension sur le marché des semi-conducteurs. Si les investisseurs parient sur une pénurie durable de mémoire HBM, poussant les prix à la hausse, l'industrie travaille activement à réduire cette dépendance. La technologie de Taalas, la compression des modèles par Nvidia, et les innovations des fondeurs de mémoire (comme le zHBM de Samsung) visent toutes à contourner ce goulet d'étranglement. En achetant Taalas, AMD investit dans une preuve que la pénurie de mémoire pour l'IA est un défi d'ingénierie surmontable, et non une fatalité. Cela rappelle que le marché de la mémoire est historiquement cyclique, et que les solutions spécialisées, bien que performantes, peuvent devenir obsolètes si les modèles d'IA évoluent trop rapidement.

cryptonews.ru08/09 20:04

AMD acquiert Taalas : l'IA matérielle se passe de la mémoire HBM, composant en pénurie

cryptonews.ru08/09 20:04

AMD achète Taalas : l'IA matérielle se passe de la mémoire HBM en pénurie

AMD acquiert Taalas : une solution matérielle pour l'IA qui se passe de mémoire HBM rare AMD a accepté d'acheter la startup torontoise Taalas, dont la technologie résout un problème majeur de l'inférence des réseaux neuronaux : la nécessité de transférer constamment les poids du modèle de la mémoire vers le processeur pour générer chaque token. Les puces de Taalas éliminent cette opération en intégrant physiquement les poids du modèle dans les transistors. Ce transfert de données limite actuellement la vitesse d'inférence et a fait de la mémoire à haut débit (HBM) un produit très rare dans l'industrie des semi-conducteurs. Fondée en 2023, Taalas a développé des circuits intégrés spécifiques à un modèle (model-specific integrated circuits). Son premier prototype, fabriqué en 6 nm par TSMC, exécute le modèle Llama 3.1 8B de Meta à une vitesse de 16 960 tokens par seconde, revendiquée comme étant bien supérieure aux solutions concurrentes. L'architecture comporte une zone où les poids sont figés dans une mémoire ROM masquée et une SRAM classique pour les caches. Cependant, cette approche présente un compromis majeur : chaque puce est dédiée à un seul modèle de manière permanente. Le changer nécessite une reconfiguration partielle de la puce, un processus prenant environ deux mois. Cette inflexibilité explique pourquoi cet achat ne bouleverse pas la rivalité entre AMD et Nvidia sur le front de l'inférence, ce dernier ayant acquis Groq pour intégrer une accélération spécialisée dans son écosystème logiciel établi. L'acquisition met en lumière les tensions sur le marché de la mémoire. La rareté et les prix élevés de la HBM sont basés sur l'hypothèse d'une demande soutenue par l'IA pour les années à venir. Pourtant, des solutions comme celles de Taalas, mais aussi les techniques de compression de Nvidia ou les innovations des fabricants de mémoire (comme la zHBM de Samsung), visent précisément à réduire cette dépendance. L'histoire cyclique du secteur de la mémoire suggère que les prix actuels pourraient ne pas durer. D'un point de vue analytique, la spécialisation extrême des puces Taalas rappelle celle des ASIC pour le minage de cryptomonnaies, apportant des gains de performance au prix d'une rigidité totale. Leur rentabilité dépendra de la stabilité future des architectures des grands modèles de langage.

cryptonews.ru08/09 14:58

AMD achète Taalas : l'IA matérielle se passe de la mémoire HBM en pénurie

cryptonews.ru08/09 14:58

La tranchée de protection CUDA que Huang a consolidée pendant 20 ans, l'IA vient de la creuser en 10 heures

CUDA, une nouvelle fois contestée ? Cette fois, c'est une IA elle-même nourrie par NVIDIA qui s'y attaque. Une jeune startup, Infinity, a utilisé un agent de programmation IA nommé Ignition pour créer, en seulement 10 heures, un logiciel de type "simili-CUDA" pour la puce d'inférence d-Matrix. Ceci illustre comment l'IA pourrait accélérer radicalement le développement de logiciels matériels de base (kernels) pour de nouveaux processeurs, particulièrement dans le domaine de l'inférence IA. Le marché de l'inférence, contrairement à l'entraînement des modèles, est considéré comme plus ouvert. Il est moins verrouillé par l'écosystème complet de CUDA, car la priorité est le coût par requête plutôt que la performance extrême et la stabilité en cluster. Des acteurs comme d-Matrix, Rebellions, Cerebras et les géants du cloud voient là une opportunité pour concurrencer NVIDIA avec des puces dédiées, potentiellement plus efficaces ou économiques pour des tâches spécifiques. Cependant, les experts tempèrent l'enthousiasme. Reproduire des kernels est une chose, mais reproduire l'immense écosystème de bibliothèques optimisées, d'outils de débogage, de validation et la communauté de développeurs construits par NVIDIA en près de 20 ans en est une autre. Le véritable goulot d'étranglement n'est pas la génération de code, mais sa validation rigoureuse pour assurer fiabilité et performance. De plus, NVIDIA utilise aussi activement l'IA pour développer et améliorer CUDA. En conclusion, si la forteresse CUDA de NVIDIA reste solide à court terme, particulièrement pour l'entraînement, le front de l'inférence pourrait voir s'ouvrir des brèches. La bataille à long terme ne se jouera peut-être plus sur la quantité de code existant, mais sur la supériorité des écosystèmes de validation, d'optimisation et de migration. La question clé est de savoir si les concurrents pourront rattraper NVIDIA plus vite que cette dernière n'évolue grâce à ses propres outils d'IA.

marsbit08/04 13:55

La tranchée de protection CUDA que Huang a consolidée pendant 20 ans, l'IA vient de la creuser en 10 heures

marsbit08/04 13:55

活动图片