Du jour au lendemain, GPT-5.6 Sol a été accéléré 14 fois par OpenAI

marsbitОпубликовано 2026-08-14Обновлено 2026-08-14

Введение

OpenAI, en partenariat avec Cerebras, a dévoilé en préversion un nouveau mode « Ultrafast » pour son modèle phare GPT-5.6 Sol. Ce mode permet d'atteindre une vitesse de génération allant jusqu'à 750 tokens par seconde, soit une accélération d'un facteur 14 par rapport au mode standard, sans perte de qualité. Il surpasse ainsi largement les performances de modèles concurrents comme Claude Fable 5 ou Opus 4.8. Cette avancée repose sur l'architecture matérielle révolutionnaire de Cerebras, utilisant des puces de la taille d'une tranche de silicium (WSE-3). Elles évitent les goulots d'étranglement de la mémoire des GPU traditionnels en conservant les paramètres du modèle dans une mémoire SRAM ultra-rapide intégrée. Lors du test exigeant « Humanity's Last Exam », GPT-5.6 Sol en mode Ultrafast a répondu à 2500 questions complexes en seulement 11 heures, contre plus de 78 heures pour un modèle rival. Cette vitesse ouvre la voie à de nouvelles applications en temps réel : réponse aux incidents techniques, analyse financière instantanée, support client avancé ou recherche interactive accélérée. Le mode Ultrafast est d'abord disponible en préversion limitée via l'API OpenAI, promettant de transformer les flux de travail nécessitant des raisonnements complexes et des appels en chaîne d'outils, en réduisant des processus de plusieurs heures à quelques minutes.

L'IA commence-t-elle à creuser l'écart d'informations ?

Le 14 août à l'aube, OpenAI, en collaboration avec le fabricant de puces IA Cerebras, a officiellement dévoilé un nouveau niveau de service pour son modèle phare GPT-5.6 Sol : le « Mode Ultra-rapide » (Ultrafast Mode).

Dans ce mode, la vitesse de sortie de GPT-5.6 Sol peut atteindre jusqu'à 750 tokens/s, soit une augmentation de vitesse pouvant aller jusqu'à 14 fois par rapport à la ligne de base d'inférence d'environ 53 tokens/s du mode Standard actuel, sans aucune perte de qualité. En comparaison, GPT-5.6 Sol accéléré est 11 fois plus rapide que Fable 5 et 5 fois plus rapide qu'Opus 4.8 en mode Fast.

Le mode Ultrafast sera d'abord lancé dans l'API d'OpenAI, et une version de prévisualisation limitée est déjà disponible pour certains clients.

Pour cela, OpenAI et Cerebras ont également établi un tableau comparant la vitesse et l'intelligence actuelles des modèles de grandes IA avancées. GPT-5.6 Sol Ultrafast occupe une position de leader absolu :

Dans le blog de Cerebras, les ingénieurs ont décrit les tests menés sur « L'Examen Final de l'Humanité » (Humanity's Last Exam, HLE), où ils ont comparé le modèle en mode Ultrafast avec ses concurrents directs. Nous savons que le HLE est un benchmark de modèles exigeant, comprenant 2500 questions, généralement réservées aux docteurs en chimie, économie ou littérature.

GPT-5.6 Sol en mode Ultra-rapide a répondu à toutes les questions en seulement 11 heures et 11 minutes. Claude Fable 5, quant à lui, a nécessité 78 heures et 27 minutes, soit plus de trois jours de calcul continu pour parvenir aux mêmes conclusions. Le mode Ultra-rapide de GPT a accompli en une journée de travail ce qui touche aux frontières du savoir humain, avec une précision similaire, et une vitesse près de 7 fois supérieure à celle de Claude Fable.

À mesure que les capacités des modèles augmentent, la portée des applications d'inférence rapide s'élargit également. GPT-5.6 Sol est jusqu'à présent le meilleur modèle d'OpenAI pour les documents juridiques, les modèles financiers et les rapports d'ingénierie. Sur le benchmark GDP-Val (qui mesure les tâches de travail intellectuel à valeur économique), Ultrafast a réalisé une amélioration de vitesse de bout en bout de 5,6 fois, sans affecter la qualité, démontrant pleinement comment une vitesse de raisonnement plus rapide peut accélérer les travaux à valeur économique.

Un traitement IA plus rapide ouvre de nombreuses possibilités pour les nouveaux flux de travail, permettant désormais de déployer des agents sur le chemin critique des problèmes. OpenAI énumère quelques scénarios d'application :

  • Réponse aux incidents et fiabilité : lorsqu'un système critique tombe en panne, l'IA analyse les journaux d'application, les récents changements de code et les rapports des ingénieurs pour déterminer les causes possibles et aider à préparer des correctifs pendant que l'incident se produit encore.
  • Recherche financière et sécurité : analyser les signaux du marché, évaluer les transactions et identifier les activités suspectes dans un contexte de marché en constante évolution.
  • Support client et vocal : résoudre en temps réel les problèmes complexes des clients, même si trouver la réponse nécessite plusieurs étapes ou systèmes, sans interrompre la conversation.
  • Commerce : répondre aux questions sur les produits, vérifier les stocks, personnaliser les recommandations et résoudre les problèmes de paiement pendant que l'acheteur hésite encore, évitant que l'hésitation ne se transforme en abandon de panier.
  • Recherche et expérimentation en temps réel : transformer des recherches qui prenaient autrefois toute une nuit en réunions de travail interactives, permettant aux équipes de tester des idées, vérifier les résultats, ajuster les méthodes et mener une autre expérience sans interrompre le flux de travail.

En interne chez OpenAI, les développeurs ont testé GPT-5.6 Sol en mode Ultra-rapide. La réponse aux incidents est un exemple d'utilisation d'Ultrafast. Lorsqu'une alerte se déclenche, les ingénieurs doivent construire une image précise de l'incident alors que les systèmes et les preuves évoluent encore. Grâce à l'intelligence de niveau Sol, les équipes peuvent rapidement lire les journaux, analyser les traces, résumer les conversations, déterminer les prochaines vérifications et aider à préparer ou valider les correctifs. Le mode Ultrafast réduit le délai entre l'observation d'un signal, la validation d'une hypothèse et le choix de la prochaine action, tandis que les ingénieurs restent responsables du jugement et du déploiement.

En recherche, l'équipe d'OpenAI utilise Ultrafast pour rechercher rapidement dans les bases de connaissances, interroger les données, et collecter, organiser et synthétiser rapidement des informations provenant de différents outils. Auparavant, un flux de recherche courant consistait à lancer un lot d'expériences la nuit et à examiner les résultats le lendemain matin. Avec Ultrafast, le processus de découverte peut être raccourci, permettant plusieurs itérations dans une journée de travail.

La percée du mode Ultrafast réside dans le contournement du goulot d'étranglement de la bande passante mémoire des clusters GPU traditionnels lors de la phase de décodage des grands modèles. Sa réalisation repose principalement sur l'architecture matérielle à l'échelle de la tranche de Cerebras.

Parmi les fabricants de puces IA, la solution de Cerebras est unique : ses générations de puces sont fabriquées sur des tranches de silicium entières, intégrant sur une seule tranche un nombre massif de cœurs de calcul et un réseau d'interconnexion ultra-rapide.

Les GPU traditionnels, lors de la génération de tokens par décodage autorégressif des grands modèles, sont limités par la bande passante de la mémoire et doivent continuellement transférer les énormes poids du modèle entre la HBM externe et les cœurs de calcul ; de plus, la partition sur plusieurs cartes entraîne des latences de communication inter-puces (PCIe/NVLink).

Chaque tranche de silicium de dernière génération de Cerebras (WSE-3) intègre 4 000 milliards de transistors, une puissance de calcul IA de 125 pétaflops et jusqu'à 44 Go de SRAM rapide sur tranche. Les paramètres du modèle résident directement dans la SRAM sur tranche à très haut débit, évitant ainsi les temps d'attente de chargement répété des poids depuis la mémoire externe.

Bien sûr, GPT-5.6 Sol, en tant que modèle phare de pointe, a un nombre total de paramètres bien supérieur à la capacité d'une puce. Cerebras dispose également d'un mécanisme de « pipeline parallèle sur plusieurs tranches » (Pipelined across wafers), qui répartit les différentes couches du réseau du modèle sur plusieurs tranches. Les paramètres de chaque couche résident dans la SRAM de leur propre tranche, permettant aux tokens de circuler de manière fluide entre les tranches.

Pour de nombreux utilisateurs de grands modèles, une accélération de 14 fois du modèle phare signifie que de nombreuses tâches qui devaient auparavant basculer vers des modèles secondaires (comme Luna et Terra) peuvent désormais être exécutées à pleine puissance en toute confiance. Pour les tâches d'agent nécessitant de multiples appels d'outils, du débogage de génération de code et une pensée en chaîne complexe, les processus qui prenaient plusieurs heures peuvent être réduits à quelques minutes.

Une vitesse plus élevée signifie peut-être aussi un changement dans notre façon d'utiliser l'IA :

Dans la communauté IA, les gens attendent déjà avec impatience les versions Ultra-rapides de Luna et Terra, en se demandant si les puces de Cerebras seront suffisantes.

Références :

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Cet article provient du compte WeChat "Machine Heart" (ID:almosthuman2014), auteur : Machine Heart, qui suit de près les grands modèles.

Трендовые криптовалюты

Связанные с этим вопросы

QQu'est-ce que le mode Ultrafast de GPT-5.6 Sol et quelle est son amélioration de vitesse ?

ALe mode Ultrafast de GPT-5.6 Sol est un nouveau niveau de service annoncé par OpenAI en collaboration avec Cerebras. Il permet d'atteindre une vitesse de génération allant jusqu'à 750 tokens par seconde, ce qui représente une accélération allant jusqu'à 14 fois par rapport au mode Standard qui délivre environ 53 tokens par seconde, sans perte de qualité.

QQuelle technologie matérielle permet cette accélération significative ?

ACette accélération significative est rendue possible grâce à l'architecture matérielle à l'échelle de la tranche de silicium (wafer-scale) de Cerebras, notamment la puce WSE-3. Cette puce intègre 4 billions de transistors et 44 Go de SRAM sur puce, permettant de maintenir les paramètres du modèle en mémoire haute bande passante pour éviter les goulets d'étranglement liés à la bande passante mémoire traditionnelle des GPU.

QQuels sont quelques exemples d'applications pratiques citées pour le mode Ultrafast ?

AL'article cite plusieurs applications pratiques, notamment : la réponse aux incidents et la fiabilité (analyse de journaux d'application), la recherche financière et la sécurité (analyse des signaux de marché), le support client et vocal (résolution de problèmes complexes en temps réel), le commerce (réponses aux questions sur les produits et recommandations personnalisées), et la recherche en temps réel permettant des itérations plus rapides lors d'expérimentations.

QComment GPT-5.6 Sol Ultrafast s'est-il performé sur le benchmark "Humanity's Last Exam" (HLE) ?

ALors des tests sur le benchmark "Humanity's Last Exam" (HLE), qui comprend 2500 questions difficiles, GPT-5.6 Sol en mode Ultrafast a répondu à toutes les questions en 11 heures et 11 minutes. En comparaison, Claude Fable 5 a nécessité 78 heures et 27 minutes, ce qui rend GPT-5.6 Sol environ 7 fois plus rapide pour ce test exigeant.

QQuelle est la principale limitation que le mode Ultrafast permet de surmonter dans le traitement des grands modèles de langage ?

ALe mode Ultrafast permet principalement de surmonter le goulot d'étranglement lié à la bande passante mémoire (mémoire HBM) dans les clusters GPU traditionnels lors de la phase de décodage autoregressif des grands modèles. En gardant les paramètres du modèle dans la SRAM sur puce à haute bande passante des puces Cerebras, il élimine le besoin de transferts constants des poids du modèle entre la mémoire externe et les cœurs de calcul, ce qui réduit considérablement les temps de latence.

Похожее

BIT Инвестиционный обзор: MicroStrategy превратилась из крупнейшего покупателя в продавца. Как потенциальное давление продаж на 75 млрд долларов повлияет на биткоин?

Компания MicroStrategy, ранее известная как крупнейший и «непродающий» покупатель биткоина, начала продажи криптовалюты для пополнения долларовых резервов, выплат и выкупа ценных бумаг. Это превращает ключевой структурный спрос в давление на рынок. Аналитики оценивают, что компании, возможно, потребуется продать еще около 4,5 млрд долларов в биткоинах в ближайшие 2-4 месяца для сокращения портфеля цифровых ценных бумаг. Более широкий потенциальный объем продаж может составить до 7,5 млрд долларов, учитывая, что 28 из 109 отслеживаемых компаний, владеющих биткоином, торгуются со скидкой к стоимости их криптоактивов (NAV < 1.0). Такие компании могут продавать BTC для выкупа акций и сокращения дисконта. Хотя макроэкономические условия улучшаются, биткоину не хватает стабильного структурного спроса, подобного акциям или золоту. Продажи MicroStrategy могут сдерживать краткосрочный оптимизм рынка, пока не вернется сильный приток в биткоин-ETF. В целом, сдвиг MicroStrategy от покупателя к продавцу меняет структуру потоков на рынке. Однако это не отменяет мнения о том, что биткоин формирует дно цикла, минимум которого ожидается в конце этого или начале следующего месяца. Ключевыми факторами станут исчерпание продаж MicroStrategy, возврат спроса через ETF и действия компаний по сокращению дисконта NAV.

marsbit1 ч. назад

BIT Инвестиционный обзор: MicroStrategy превратилась из крупнейшего покупателя в продавца. Как потенциальное давление продаж на 75 млрд долларов повлияет на биткоин?

marsbit1 ч. назад

Galaxy снижает шансы на принятие Закона о ясности (CLARITY) до 10%

Galaxy Digital снизила свою оценку вероятности принятия Закона о ясности рынка цифровых активов (CLARITY Act) в 2026 году до 10%. Аналитики предупреждают, что остаются нерешенными множество политических вопросов, и у Сената будет всего около двух-трех недель для его утверждения после возобновления работы 14 сентября. Глава исследовательского отдела Galaxy Алекс Торн отметил, что для прохождения закона он должен будет доминировать практически во всей рабочей сессии, иначе времени не хватит. Среди ключевых спорных моментов — этические правила для госслужащих в криптосфере и давление со стороны банков относительно положений о доходах от стейблкоинов. Ранее Galaxy уже снижала прогнозы с 75% до 60% в начале июня и с 60% до 50% в конце июня. Закон, направленный на создание первого в США регуляторного режима для цифровых активов, был одобрен комитетом по банковскому делу Сената в мае, но столкнулся с сопротивлением большинства демократов и банковской индустрии, которые критикуют возможность криптокомпаний предлагать доходность по стейблкоинам без банковских требований. В начале июня более 200 криптокомпаний и организаций призвали Сенат принять данный закон.

cointelegraph2 ч. назад

Galaxy снижает шансы на принятие Закона о ясности (CLARITY) до 10%

cointelegraph2 ч. назад

Илон Маск строит Terafab: крупнейший завод чипов для ИИ, роботов и космических дата-центров

SpaceX и Tesla запустили проект Terafab по строительству крупнейшего в мире полупроводникового завода в Техасе. Первая очередь, стоимостью $16,8 млрд, займет более 9,3 млн кв. м и создаст 3000 рабочих мест. Цель — производство вычислительных мощностей свыше 1 тераватта в год для роботов Optimus, беспилотных автомобилей Cybercab и орбитальных дата-центров SpaceX. Проект получил государственную поддержку, включая грант Texas Enterprise Fund. Ключевым технологическим партнером выступит Intel с использованием техпроцесса 14A. Инициатива направлена на диверсификацию цепочек поставок и укрепление позиций США в глобальной технологической конкуренции, в контексте программ вроде Pax Silica. Однако опыт подобных мегапроектов, таких как завод Intel в Огайо, показывает, что реализация часто сталкивается с задержками и непредвиденными сложностями.

cryptonews.ru2 ч. назад

Илон Маск строит Terafab: крупнейший завод чипов для ИИ, роботов и космических дата-центров

cryptonews.ru2 ч. назад

"AI-божество" потянуло за собой: Jane Street потеряла в июле 15 млрд долларов, впервые за десять лет показав убыток за месяц

Одна из самых загадочных и прибыльных компаний проп-трейдинга Уолл-стрит, Jane Street, понесла в июле рекордные убытки в размере около 15 миллиардов долларов, что стало ее первым месячным убытком за примерно десять лет. Основными причинами стали проблемы у хедж-фонда, инвестировавшего в акции AI, Situational Awareness, который из-за резкого падения котировок был вынужден распродать активы, а также убытки по другим технологическим акциям в Азии. Несмотря на серьезный единичный убыток, чистая торговая выручка Jane Street с начала года все еще превышает 40 миллиардов долларов. Компания заявила, что закроет часть рискованных позиций, приведших к потерям, и в целом станет более избирательной в принятии рисков. На фоне этих событий Jane Street также проводит рефинансирование долга на сумму около 14,6 миллиарда долларов, переводя часть обязательств с публичного на частный рынок, чтобы повысить гибкость и сократить раскрытие информации, даже ценой более высоких затрат на финансирование. Ситуация с фондом Situational Awareness высветила риски в экосистеме прайм-брокеров, где высокая долговая нагрузка и схожие инвестиции многих фондов в одни и те же активы AI могут привести к каскадным продажам при смене рыночной конъюнктуры.

marsbit2 ч. назад

"AI-божество" потянуло за собой: Jane Street потеряла в июле 15 млрд долларов, впервые за десять лет показав убыток за месяц

marsbit2 ч. назад

Торговля

Спот

Популярные статьи

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на SOL (SOL) представлены ниже.

活动图片