L'IA commence-t-elle à creuser l'écart d'informations ?
Le 14 août à l'aube, OpenAI, en collaboration avec le fabricant de puces IA Cerebras, a officiellement dévoilé un nouveau niveau de service pour son modèle phare GPT-5.6 Sol : le « Mode Ultra-rapide » (Ultrafast Mode).
Dans ce mode, la vitesse de sortie de GPT-5.6 Sol peut atteindre jusqu'à 750 tokens/s, soit une augmentation de vitesse pouvant aller jusqu'à 14 fois par rapport à la ligne de base d'inférence d'environ 53 tokens/s du mode Standard actuel, sans aucune perte de qualité. En comparaison, GPT-5.6 Sol accéléré est 11 fois plus rapide que Fable 5 et 5 fois plus rapide qu'Opus 4.8 en mode Fast.
Le mode Ultrafast sera d'abord lancé dans l'API d'OpenAI, et une version de prévisualisation limitée est déjà disponible pour certains clients.

Pour cela, OpenAI et Cerebras ont également établi un tableau comparant la vitesse et l'intelligence actuelles des modèles de grandes IA avancées. GPT-5.6 Sol Ultrafast occupe une position de leader absolu :

Dans le blog de Cerebras, les ingénieurs ont décrit les tests menés sur « L'Examen Final de l'Humanité » (Humanity's Last Exam, HLE), où ils ont comparé le modèle en mode Ultrafast avec ses concurrents directs. Nous savons que le HLE est un benchmark de modèles exigeant, comprenant 2500 questions, généralement réservées aux docteurs en chimie, économie ou littérature.
GPT-5.6 Sol en mode Ultra-rapide a répondu à toutes les questions en seulement 11 heures et 11 minutes. Claude Fable 5, quant à lui, a nécessité 78 heures et 27 minutes, soit plus de trois jours de calcul continu pour parvenir aux mêmes conclusions. Le mode Ultra-rapide de GPT a accompli en une journée de travail ce qui touche aux frontières du savoir humain, avec une précision similaire, et une vitesse près de 7 fois supérieure à celle de Claude Fable.

À mesure que les capacités des modèles augmentent, la portée des applications d'inférence rapide s'élargit également. GPT-5.6 Sol est jusqu'à présent le meilleur modèle d'OpenAI pour les documents juridiques, les modèles financiers et les rapports d'ingénierie. Sur le benchmark GDP-Val (qui mesure les tâches de travail intellectuel à valeur économique), Ultrafast a réalisé une amélioration de vitesse de bout en bout de 5,6 fois, sans affecter la qualité, démontrant pleinement comment une vitesse de raisonnement plus rapide peut accélérer les travaux à valeur économique.

Un traitement IA plus rapide ouvre de nombreuses possibilités pour les nouveaux flux de travail, permettant désormais de déployer des agents sur le chemin critique des problèmes. OpenAI énumère quelques scénarios d'application :
- Réponse aux incidents et fiabilité : lorsqu'un système critique tombe en panne, l'IA analyse les journaux d'application, les récents changements de code et les rapports des ingénieurs pour déterminer les causes possibles et aider à préparer des correctifs pendant que l'incident se produit encore.
- Recherche financière et sécurité : analyser les signaux du marché, évaluer les transactions et identifier les activités suspectes dans un contexte de marché en constante évolution.
- Support client et vocal : résoudre en temps réel les problèmes complexes des clients, même si trouver la réponse nécessite plusieurs étapes ou systèmes, sans interrompre la conversation.
- Commerce : répondre aux questions sur les produits, vérifier les stocks, personnaliser les recommandations et résoudre les problèmes de paiement pendant que l'acheteur hésite encore, évitant que l'hésitation ne se transforme en abandon de panier.
- Recherche et expérimentation en temps réel : transformer des recherches qui prenaient autrefois toute une nuit en réunions de travail interactives, permettant aux équipes de tester des idées, vérifier les résultats, ajuster les méthodes et mener une autre expérience sans interrompre le flux de travail.
En interne chez OpenAI, les développeurs ont testé GPT-5.6 Sol en mode Ultra-rapide. La réponse aux incidents est un exemple d'utilisation d'Ultrafast. Lorsqu'une alerte se déclenche, les ingénieurs doivent construire une image précise de l'incident alors que les systèmes et les preuves évoluent encore. Grâce à l'intelligence de niveau Sol, les équipes peuvent rapidement lire les journaux, analyser les traces, résumer les conversations, déterminer les prochaines vérifications et aider à préparer ou valider les correctifs. Le mode Ultrafast réduit le délai entre l'observation d'un signal, la validation d'une hypothèse et le choix de la prochaine action, tandis que les ingénieurs restent responsables du jugement et du déploiement.
En recherche, l'équipe d'OpenAI utilise Ultrafast pour rechercher rapidement dans les bases de connaissances, interroger les données, et collecter, organiser et synthétiser rapidement des informations provenant de différents outils. Auparavant, un flux de recherche courant consistait à lancer un lot d'expériences la nuit et à examiner les résultats le lendemain matin. Avec Ultrafast, le processus de découverte peut être raccourci, permettant plusieurs itérations dans une journée de travail.
La percée du mode Ultrafast réside dans le contournement du goulot d'étranglement de la bande passante mémoire des clusters GPU traditionnels lors de la phase de décodage des grands modèles. Sa réalisation repose principalement sur l'architecture matérielle à l'échelle de la tranche de Cerebras.

Parmi les fabricants de puces IA, la solution de Cerebras est unique : ses générations de puces sont fabriquées sur des tranches de silicium entières, intégrant sur une seule tranche un nombre massif de cœurs de calcul et un réseau d'interconnexion ultra-rapide.
Les GPU traditionnels, lors de la génération de tokens par décodage autorégressif des grands modèles, sont limités par la bande passante de la mémoire et doivent continuellement transférer les énormes poids du modèle entre la HBM externe et les cœurs de calcul ; de plus, la partition sur plusieurs cartes entraîne des latences de communication inter-puces (PCIe/NVLink).
Chaque tranche de silicium de dernière génération de Cerebras (WSE-3) intègre 4 000 milliards de transistors, une puissance de calcul IA de 125 pétaflops et jusqu'à 44 Go de SRAM rapide sur tranche. Les paramètres du modèle résident directement dans la SRAM sur tranche à très haut débit, évitant ainsi les temps d'attente de chargement répété des poids depuis la mémoire externe.
Bien sûr, GPT-5.6 Sol, en tant que modèle phare de pointe, a un nombre total de paramètres bien supérieur à la capacité d'une puce. Cerebras dispose également d'un mécanisme de « pipeline parallèle sur plusieurs tranches » (Pipelined across wafers), qui répartit les différentes couches du réseau du modèle sur plusieurs tranches. Les paramètres de chaque couche résident dans la SRAM de leur propre tranche, permettant aux tokens de circuler de manière fluide entre les tranches.
Pour de nombreux utilisateurs de grands modèles, une accélération de 14 fois du modèle phare signifie que de nombreuses tâches qui devaient auparavant basculer vers des modèles secondaires (comme Luna et Terra) peuvent désormais être exécutées à pleine puissance en toute confiance. Pour les tâches d'agent nécessitant de multiples appels d'outils, du débogage de génération de code et une pensée en chaîne complexe, les processus qui prenaient plusieurs heures peuvent être réduits à quelques minutes.
Une vitesse plus élevée signifie peut-être aussi un changement dans notre façon d'utiliser l'IA :

Dans la communauté IA, les gens attendent déjà avec impatience les versions Ultra-rapides de Luna et Terra, en se demandant si les puces de Cerebras seront suffisantes.
Références :
https://openai.com/index/previewing-ultrafast/
https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
Cet article provient du compte WeChat "Machine Heart" (ID:almosthuman2014), auteur : Machine Heart, qui suit de près les grands modèles.







