Du jour au lendemain, GPT-5.6 Sol a été accéléré 14 fois par OpenAI

marsbit发布于2026-08-14更新于2026-08-14

文章摘要

OpenAI, en partenariat avec Cerebras, a dévoilé en préversion un nouveau mode « Ultrafast » pour son modèle phare GPT-5.6 Sol. Ce mode permet d'atteindre une vitesse de génération allant jusqu'à 750 tokens par seconde, soit une accélération d'un facteur 14 par rapport au mode standard, sans perte de qualité. Il surpasse ainsi largement les performances de modèles concurrents comme Claude Fable 5 ou Opus 4.8. Cette avancée repose sur l'architecture matérielle révolutionnaire de Cerebras, utilisant des puces de la taille d'une tranche de silicium (WSE-3). Elles évitent les goulots d'étranglement de la mémoire des GPU traditionnels en conservant les paramètres du modèle dans une mémoire SRAM ultra-rapide intégrée. Lors du test exigeant « Humanity's Last Exam », GPT-5.6 Sol en mode Ultrafast a répondu à 2500 questions complexes en seulement 11 heures, contre plus de 78 heures pour un modèle rival. Cette vitesse ouvre la voie à de nouvelles applications en temps réel : réponse aux incidents techniques, analyse financière instantanée, support client avancé ou recherche interactive accélérée. Le mode Ultrafast est d'abord disponible en préversion limitée via l'API OpenAI, promettant de transformer les flux de travail nécessitant des raisonnements complexes et des appels en chaîne d'outils, en réduisant des processus de plusieurs heures à quelques minutes.

L'IA commence-t-elle à creuser l'écart d'informations ?

Le 14 août à l'aube, OpenAI, en collaboration avec le fabricant de puces IA Cerebras, a officiellement dévoilé un nouveau niveau de service pour son modèle phare GPT-5.6 Sol : le « Mode Ultra-rapide » (Ultrafast Mode).

Dans ce mode, la vitesse de sortie de GPT-5.6 Sol peut atteindre jusqu'à 750 tokens/s, soit une augmentation de vitesse pouvant aller jusqu'à 14 fois par rapport à la ligne de base d'inférence d'environ 53 tokens/s du mode Standard actuel, sans aucune perte de qualité. En comparaison, GPT-5.6 Sol accéléré est 11 fois plus rapide que Fable 5 et 5 fois plus rapide qu'Opus 4.8 en mode Fast.

Le mode Ultrafast sera d'abord lancé dans l'API d'OpenAI, et une version de prévisualisation limitée est déjà disponible pour certains clients.

Pour cela, OpenAI et Cerebras ont également établi un tableau comparant la vitesse et l'intelligence actuelles des modèles de grandes IA avancées. GPT-5.6 Sol Ultrafast occupe une position de leader absolu :

Dans le blog de Cerebras, les ingénieurs ont décrit les tests menés sur « L'Examen Final de l'Humanité » (Humanity's Last Exam, HLE), où ils ont comparé le modèle en mode Ultrafast avec ses concurrents directs. Nous savons que le HLE est un benchmark de modèles exigeant, comprenant 2500 questions, généralement réservées aux docteurs en chimie, économie ou littérature.

GPT-5.6 Sol en mode Ultra-rapide a répondu à toutes les questions en seulement 11 heures et 11 minutes. Claude Fable 5, quant à lui, a nécessité 78 heures et 27 minutes, soit plus de trois jours de calcul continu pour parvenir aux mêmes conclusions. Le mode Ultra-rapide de GPT a accompli en une journée de travail ce qui touche aux frontières du savoir humain, avec une précision similaire, et une vitesse près de 7 fois supérieure à celle de Claude Fable.

À mesure que les capacités des modèles augmentent, la portée des applications d'inférence rapide s'élargit également. GPT-5.6 Sol est jusqu'à présent le meilleur modèle d'OpenAI pour les documents juridiques, les modèles financiers et les rapports d'ingénierie. Sur le benchmark GDP-Val (qui mesure les tâches de travail intellectuel à valeur économique), Ultrafast a réalisé une amélioration de vitesse de bout en bout de 5,6 fois, sans affecter la qualité, démontrant pleinement comment une vitesse de raisonnement plus rapide peut accélérer les travaux à valeur économique.

Un traitement IA plus rapide ouvre de nombreuses possibilités pour les nouveaux flux de travail, permettant désormais de déployer des agents sur le chemin critique des problèmes. OpenAI énumère quelques scénarios d'application :

  • Réponse aux incidents et fiabilité : lorsqu'un système critique tombe en panne, l'IA analyse les journaux d'application, les récents changements de code et les rapports des ingénieurs pour déterminer les causes possibles et aider à préparer des correctifs pendant que l'incident se produit encore.
  • Recherche financière et sécurité : analyser les signaux du marché, évaluer les transactions et identifier les activités suspectes dans un contexte de marché en constante évolution.
  • Support client et vocal : résoudre en temps réel les problèmes complexes des clients, même si trouver la réponse nécessite plusieurs étapes ou systèmes, sans interrompre la conversation.
  • Commerce : répondre aux questions sur les produits, vérifier les stocks, personnaliser les recommandations et résoudre les problèmes de paiement pendant que l'acheteur hésite encore, évitant que l'hésitation ne se transforme en abandon de panier.
  • Recherche et expérimentation en temps réel : transformer des recherches qui prenaient autrefois toute une nuit en réunions de travail interactives, permettant aux équipes de tester des idées, vérifier les résultats, ajuster les méthodes et mener une autre expérience sans interrompre le flux de travail.

En interne chez OpenAI, les développeurs ont testé GPT-5.6 Sol en mode Ultra-rapide. La réponse aux incidents est un exemple d'utilisation d'Ultrafast. Lorsqu'une alerte se déclenche, les ingénieurs doivent construire une image précise de l'incident alors que les systèmes et les preuves évoluent encore. Grâce à l'intelligence de niveau Sol, les équipes peuvent rapidement lire les journaux, analyser les traces, résumer les conversations, déterminer les prochaines vérifications et aider à préparer ou valider les correctifs. Le mode Ultrafast réduit le délai entre l'observation d'un signal, la validation d'une hypothèse et le choix de la prochaine action, tandis que les ingénieurs restent responsables du jugement et du déploiement.

En recherche, l'équipe d'OpenAI utilise Ultrafast pour rechercher rapidement dans les bases de connaissances, interroger les données, et collecter, organiser et synthétiser rapidement des informations provenant de différents outils. Auparavant, un flux de recherche courant consistait à lancer un lot d'expériences la nuit et à examiner les résultats le lendemain matin. Avec Ultrafast, le processus de découverte peut être raccourci, permettant plusieurs itérations dans une journée de travail.

La percée du mode Ultrafast réside dans le contournement du goulot d'étranglement de la bande passante mémoire des clusters GPU traditionnels lors de la phase de décodage des grands modèles. Sa réalisation repose principalement sur l'architecture matérielle à l'échelle de la tranche de Cerebras.

Parmi les fabricants de puces IA, la solution de Cerebras est unique : ses générations de puces sont fabriquées sur des tranches de silicium entières, intégrant sur une seule tranche un nombre massif de cœurs de calcul et un réseau d'interconnexion ultra-rapide.

Les GPU traditionnels, lors de la génération de tokens par décodage autorégressif des grands modèles, sont limités par la bande passante de la mémoire et doivent continuellement transférer les énormes poids du modèle entre la HBM externe et les cœurs de calcul ; de plus, la partition sur plusieurs cartes entraîne des latences de communication inter-puces (PCIe/NVLink).

Chaque tranche de silicium de dernière génération de Cerebras (WSE-3) intègre 4 000 milliards de transistors, une puissance de calcul IA de 125 pétaflops et jusqu'à 44 Go de SRAM rapide sur tranche. Les paramètres du modèle résident directement dans la SRAM sur tranche à très haut débit, évitant ainsi les temps d'attente de chargement répété des poids depuis la mémoire externe.

Bien sûr, GPT-5.6 Sol, en tant que modèle phare de pointe, a un nombre total de paramètres bien supérieur à la capacité d'une puce. Cerebras dispose également d'un mécanisme de « pipeline parallèle sur plusieurs tranches » (Pipelined across wafers), qui répartit les différentes couches du réseau du modèle sur plusieurs tranches. Les paramètres de chaque couche résident dans la SRAM de leur propre tranche, permettant aux tokens de circuler de manière fluide entre les tranches.

Pour de nombreux utilisateurs de grands modèles, une accélération de 14 fois du modèle phare signifie que de nombreuses tâches qui devaient auparavant basculer vers des modèles secondaires (comme Luna et Terra) peuvent désormais être exécutées à pleine puissance en toute confiance. Pour les tâches d'agent nécessitant de multiples appels d'outils, du débogage de génération de code et une pensée en chaîne complexe, les processus qui prenaient plusieurs heures peuvent être réduits à quelques minutes.

Une vitesse plus élevée signifie peut-être aussi un changement dans notre façon d'utiliser l'IA :

Dans la communauté IA, les gens attendent déjà avec impatience les versions Ultra-rapides de Luna et Terra, en se demandant si les puces de Cerebras seront suffisantes.

Références :

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Cet article provient du compte WeChat "Machine Heart" (ID:almosthuman2014), auteur : Machine Heart, qui suit de près les grands modèles.

热门币种推荐

相关问答

QQu'est-ce que le mode Ultrafast de GPT-5.6 Sol et quelle est son amélioration de vitesse ?

ALe mode Ultrafast de GPT-5.6 Sol est un nouveau niveau de service annoncé par OpenAI en collaboration avec Cerebras. Il permet d'atteindre une vitesse de génération allant jusqu'à 750 tokens par seconde, ce qui représente une accélération allant jusqu'à 14 fois par rapport au mode Standard qui délivre environ 53 tokens par seconde, sans perte de qualité.

QQuelle technologie matérielle permet cette accélération significative ?

ACette accélération significative est rendue possible grâce à l'architecture matérielle à l'échelle de la tranche de silicium (wafer-scale) de Cerebras, notamment la puce WSE-3. Cette puce intègre 4 billions de transistors et 44 Go de SRAM sur puce, permettant de maintenir les paramètres du modèle en mémoire haute bande passante pour éviter les goulets d'étranglement liés à la bande passante mémoire traditionnelle des GPU.

QQuels sont quelques exemples d'applications pratiques citées pour le mode Ultrafast ?

AL'article cite plusieurs applications pratiques, notamment : la réponse aux incidents et la fiabilité (analyse de journaux d'application), la recherche financière et la sécurité (analyse des signaux de marché), le support client et vocal (résolution de problèmes complexes en temps réel), le commerce (réponses aux questions sur les produits et recommandations personnalisées), et la recherche en temps réel permettant des itérations plus rapides lors d'expérimentations.

QComment GPT-5.6 Sol Ultrafast s'est-il performé sur le benchmark "Humanity's Last Exam" (HLE) ?

ALors des tests sur le benchmark "Humanity's Last Exam" (HLE), qui comprend 2500 questions difficiles, GPT-5.6 Sol en mode Ultrafast a répondu à toutes les questions en 11 heures et 11 minutes. En comparaison, Claude Fable 5 a nécessité 78 heures et 27 minutes, ce qui rend GPT-5.6 Sol environ 7 fois plus rapide pour ce test exigeant.

QQuelle est la principale limitation que le mode Ultrafast permet de surmonter dans le traitement des grands modèles de langage ?

ALe mode Ultrafast permet principalement de surmonter le goulot d'étranglement lié à la bande passante mémoire (mémoire HBM) dans les clusters GPU traditionnels lors de la phase de décodage autoregressif des grands modèles. En gardant les paramètres du modèle dans la SRAM sur puce à haute bande passante des puces Cerebras, il élimine le besoin de transferts constants des poids du modèle entre la mémoire externe et les cœurs de calcul, ce qui réduit considérablement les temps de latence.

你可能也喜欢

交易

现货

热门文章

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对SOL(SOL)币价的意见。

活动图片