OpenAI « renverse la table » : son puce de déduction maison « Jalapeño » surpasse NVIDIA

marsbitPublié le 2026-08-25Dernière mise à jour le 2026-08-25

Résumé

OpenAI dévoile les premiers résultats de sa puce d’inférence maison « Jalapeño », conçue pour accélérer l’exécution des grands modèles de langage. En partenariat avec Cerebras, cette puce spécialisée promet de concilier haut débit et faible latence, surpassant les systèmes NVIDIA GB200/GB300 sur plusieurs benchmarks. Testée sur des modèles comme GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, elle offre jusqu’à 1,9 fois plus de traitement par watt et réduit la latence d’un facteur allant jusqu’à 3,6. Optimisée pour les agents IA interactifs, elle permet des gains encore plus marqués dans les scénarios exigeant des réponses ultra-rapides. Le développement a été accéléré par l’utilisation d’outils d’IA, avec une conception aboutie en seulement neuf mois. OpenAI prévoit un déploiement dans ses infrastructures fin 2026, tout en continuant à utiliser massivement les accélérateurs NVIDIA. Les versions de deuxième et troisième génération sont déjà en préparation.

En se réveillant ce matin, les nouvelles concernant OpenAI volent littéralement de partout.

D'abord, l'utilisateur X Leo@synthwavedd a affirmé de manière exclusive :OpenAI a terminé un nouveau pré-entraînement, nom de code « Bel », dont la taille des paramètres serait supérieure à 10 billions, potentiellement le successeur de Doug, et pourrait devenir le modèle de base pour Astra /GPT-6......

Après une recherche rapide, il s'avère qu'il n'existe pas d'informations exactes. Cependant, une chose est certaine : la première puce de déduction (inference) conçue en interne par OpenAI a produit des résultats.

À l'instant même,OpenAI a publié les derniers résultats de tests de sa première puce de déduction maison, Jalapeño : une percée majeure a été réalisée.Cette puce est conçue spécifiquement pour le déduire des grands modèles de langage. Grâce à une nouvelle architecture, elle parvient à augmenter simultanément le débit (throughput) et à réduire la latence, tout en maintenant une haute efficacité énergétique, conciliant les deux objectifs. Elle surpasse également les performances d'efficacité des systèmes NVIDIA GB200 et GB300 dans les tests sur plusieurs modèles.

Peu après, Sam Altman, le PDG d'OpenAI, a déclaré sur X : « Nous avons fabriqué une puce, et elle est rapide. »

Il est important de noter qu'en tant que première puce de déduction maison d'OpenAI,Jalapeño n'est pas une puce destinée à l'entraînement de la prochaine génération de modèles GPT, mais optimisée pour la phase d'exécution après le déploiement des modèles.

En termes simples : la phase d'entraînement consiste à apprendre des capacités au modèle, tandis que la phase de déduction consiste à répondre rapidement aux demandes des utilisateurs. Jalapeño s'attaque principalement au deuxième problème.

OpenAI indique que les systèmes matériels traditionnels sont souvent confrontés à un compromis entre deux indicateurs :

  • Un débit plus élevé (throughput) : traiter plus de requêtes par unité de temps ;
  • Une latence plus faible (latency) : permettre aux utilisateurs d'obtenir une réponse plus rapidement.

Par exemple, le traitement par lots à grande échelle peut améliorer l'efficacité globale, mais peut augmenter le temps d'attente pour une requête individuelle ; tandis que la recherche d'une latence extrêmement faible peut sacrifier le taux d'utilisation des ressources. L'objectif de Jalapeño est d'optimiser simultanément les deux au sein d'une même architecture.

En termes de performances spécifiques, OpenAI affirme que dans plusieurs tests de déduction sur de grands modèles,Jalapeño est supérieur aux systèmes NVIDIA GB200 et GB300. Les modèles testés incluent :OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T.

La présence notable deDeepSeek R1 et Kimi K2.5 semble indiquer que Jalapeño n'est pas optimisé uniquement pour les propres modèles d'OpenAI, mais peut s'adapter à différentes charges de travail de grands modèles.

Fait intéressant, Jalapeño peut être traduit par « piment jalapeño », et cette nouvelle a immédiatement suscité des réactions amusées et des discussions animées parmi les internautes.

« Tu vas nommer ta puce d'après un piment ? J'ai hâte de l'essayer. »

Pour OpenAI, le lancement de Jalapeño indique que l'entreprise tente d'établir une chaîne complète « modèle — logiciel — puce — centre de données ».

Un autre point à noter est que pour cette puce Jalapeño, OpenAI a collaboré sur le plan matériel avec Cerebras.

Tibo a publié un message disant : « Cette capacité est le fruit de notre collaboration approfondie avec Cerebras et de leur architecture matérielle unique. À l'avenir, cette collaboration continuera de repousser les limites de l'expérience « ultra-rapide ». J'attends avec impatience que nous continuions à travailler ensemble, repoussant sans cesse les limites sur la plateforme Cerebras, explorant comment exécuter nos modèles les plus puissants à la vitesse maximale, et apportant cette expérience aux clients les plus exigeants en matière de performances. »

En réalité, OpenAI n'est pas la première entreprise d'IA à se lancer dans la conception de puces maison. De nombreuses grandes entreprises d'IA s'y sont déjà mises précédemment. Par exemple, Google a lancé le TPU ; Amazon a développé Trainium et Inferentia ; Microsoft avance sur Maia ; Meta déploie également son propre accélérateur d'IA maison......

La logique sous-jacente est très similaire : les GPU grand public sont suffisamment flexibles, mais ne sont pas optimisés pour toutes les charges de travail d'IA. Pour les entreprises qui exécutent quotidiennement des volumes massifs de requêtes d'IA, si elles peuvent concevoir des puces adaptées à leurs propres modèles, systèmes logiciels et modes de service, elles ont une chance de réduire davantage les coûts......

Examinons maintenant de plus près les capacités de Jalapeño.

Plus rapide, plus économe en énergie

L'avantage principal de Jalapeño est d'accomplir plus de travail d'IA pour une même consommation électrique, tout en renvoyant les réponses plus rapidement. Les systèmes existants doivent généralement faire un compromis entre débit et latence, tandis que Jalapeño tente, avec une seule architecture, d'atteindre simultanément un débit plus élevé et une latence plus faible.

OpenAI souligne que cet avantage n'apparaît pas seulement sur ses propres modèles, mais aussi sur des modèles développés par des tiers, prouvant que Jalapeño est une architecture de déduction plus universelle.

Sur les trois modèles publics GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, Jalapeño a réalisé 1,5 à 1,9 fois plus de travail d'IA par watt au débit de pointe, tout en réduisant la latence de bout en bout à 1/1,7 à 1/3,6 de celle des systèmes de comparaison ; pour les charges de travail hautement interactives, l'avantage de performance atteint 2,1 à 4,1 fois.

Sur GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, le débit par watt de pointe de Jalapeño atteint respectivement 1,9 fois, 1,7 fois et 1,5 fois celui des meilleurs systèmes existants.

Sur le modèle de plus grande taille, Kimi K2.5, les performances de pointe par watt de Jalapeño sont améliorées d'environ 1,5 fois, et la latence de bout en bout est réduite d'environ 3,4 fois.

Sur Kimi K2.5 1T, à mesure que la vitesse de décodage pour un seul utilisateur augmente, l'avantage de débit par watt de Jalapeño par rapport au GB300 passe de 1,5 fois au pic à un maximum de 56,1 fois.

OpenAI ne s'est pas contenté de comparer les performances de pointe d'une seule puce, mais s'est davantage concentré sur un indicateur : la quantité de travail d'IA utile pouvant être accomplie par unité d'énergie, tout en respectant les exigences de latence des utilisateurs et des agents interactifs.

La raison est également liée aux agents. Les agents doivent souvent effectuer plusieurs étapes consécutives, et une latence apparemment faible dans une seule requête peut s'accumuler tout au long de l'exécution de la tâche.

C'est également là que Jalapeño montre ses capacités les plus évidentes dans les plages de faible latence. Prenons l'exemple de DeepSeek R1 : dans les conditions correspondant au meilleur TBT précédent du système de comparaison, le débit par kilowatt de Jalapeño atteint 12 258 TPS mixtes/kW, contre 118 pour le GB300, soit une différence d'environ 104,3 fois.

Sur DeepSeek R1 670B, le débit de pointe par watt de Jalapeño est environ 1,7 fois supérieur à celui du GB300 ; à vitesse de décodage égale, l'avantage peut atteindre jusqu'à 104,3 fois.

OpenAI a utilisé le benchmark public InferenceX de SemiAnalysis pour les tests et a comparé avec les systèmes commerciaux actuellement les plus performants. Des services à haut débit aux scénarios hautement interactifs à faible latence, Jalapeño a réalisé de meilleures combinaisons de performances par watt et de latence sur les trois modèles publics, se situant sur la frontière de Pareto (Pareto frontier).

À différents points de fonctionnement de DeepSeek R1 670B, Jalapeño forme une combinaison plus optimale entre le débit par watt, la vitesse d'interaction et la latence de bout en bout, se situant sur la frontière de Pareto (Pareto frontier).

La puissance nominale de Jalapeño est de 700W, mais dans les charges de travail testées, la puissance consommée en continu est restée à 550W ou en dessous.

Conçu pour les agents

Jalapeño a été conçu dès le départ pour les grands modèles de langage actuels et futurs, en particulier les agents interactifs.

Les différentes phases de la déduction des LLM ont des goulots d'étranglement différents : le Prefill dépend davantage de la capacité de calcul, le Decode est plus limité par la bande passante mémoire, et le mouvement des données entre les cœurs et les puces peut également augmenter la latence.

Par conséquent, OpenAI a co-conçu le système au niveau de la puce, de la mémoire, du réseau, du logiciel et du baie. L'état du modèle, y compris le KV Cache, peut être explicitement placé et maintenu localement autant que possible, permettant à Jalapeño de s'adapter simultanément au Prefill et au Decode, et de s'ajuster aux variations de charge de travail des deux.

OpenAI estime que c'est précisément la caractéristique clé des charges de travail des agents.

Fait intéressant,l'IA n'est pas seulement l'objet que Jalapeño doit servir, elle a également directement participé au développement de cette puce.

En utilisant des modèles à différents stades, l'équipe d'OpenAI n'a eu besoin que de 9 mois, de la conception initiale au Tape-out (finalisation de la conception pour la gravure). Les modèles ont été utilisés pour explorer différentes implémentations, raccourcir les cycles de conception, de mesure et de validation, et ont également participé à l'optimisation des circuits arithmétiques de la puce.

Jalapeño a également été conçu comme une cible de programmation claire et prévisible, tant pour les humains que pour les modèles. En utilisant le Codex piloté par GPT-Astra, l'équipe n'a eu besoin que de 2 mois pour faire fonctionner avec des performances élevées trois modèles open weight qui n'étaient pas initialement prévus dans le plan de production initial de Jalapeño.

Dans certains modules d'attention GPT-OSS et modules MoE, les implémentations générées par Codex se sont même révélées 1,5 à 1,8 fois plus rapides que les versions originales écrites à la main par des experts humains.

Déploiement fin 2026, les générations 2 et 3 sont déjà en route

OpenAI prévoit de commencer le déploiement de Jalapeño dans sa propre infrastructure de calcul avant fin 2026. Actuellement, l'équipe procède toujours à la validation en production, perfectionne le logiciel, se prépare pour une exécution à grande échelle et continue de vérifier les performances sur davantage de modèles.

Les produits suivants sont déjà lancés : la Gen 2 est entrée dans une phase de développement avancé, et la Gen 3 commence déjà à prendre forme.

OpenAI résume les changements d'efficacité apportés par Jalapeño en trois paliers : le mode Ultra-fast, qui peut atteindre l'efficacité que seul le mode Fast offrait auparavant ; le mode Fast, qui peut atteindre l'efficacité que seul le mode Batch offrait auparavant ; et le mode Batch lui-même, dont l'efficacité est encore améliorée.

Cependant, la conception de puces maison ne signifie pas qu'OpenAI se prépare à se passer de NVIDIA.

OpenAI indique clairement que pour répondre à la demande croissante d'IA, davantage de puissance de calcul provenant de toutes les sources disponibles est nécessaire. L'entreprise continuera à déployer à grande échelle les accélérateurs de NVIDIA et d'autres partenaires, tout en couvrant les charges de travail d'entraînement et de déduction.

Qu'en pensez-vous ? N'hésitez pas à laisser un commentaire et à échanger !

Liens de référence :

https://x.com/OpenAI/status/2092300846675505602

https://x.com/sama/status/2092339694210040187

https://openai.com/index/jalapeno-first-results/

https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/

Cet article provient du compte public WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart intéressé par l'IA, éditeurs : Shan Hui, Youli

Cryptos en tendance

Questions liées

QQuel est le nom de la première puce d'inférence conçue par OpenAI et quelle est sa particularité ?

ALa première puce d'inférence conçue par OpenAI s'appelle Jalapeño (ou "Mexican Chili"). Sa particularité est qu'elle est spécialement optimisée pour l'inférence des grands modèles de langage, en offrant à la fois un débit (throughput) élevé et une faible latence, tout en étant plus économe en énergie que les systèmes NVIDIA GB200 et GB300.

QPour quelles raisons les grandes entreprises technologiques comme OpenAI développent-elles leurs propres puces IA ?

ALes grandes entreprises technologiques développent leurs propres puces IA car les GPU généralistes, bien que flexibles, ne sont pas optimisés pour toutes les charges de travail d'IA. En concevant des puces adaptées à leurs modèles, logiciels et modes de service spécifiques, elles peuvent réduire les coûts et améliorer les performances pour leurs applications à grande échelle.

QQuels modèles de langage ont été utilisés pour tester les performances de la puce Jalapeño ?

ALes performances de la puce Jalapeño ont été testées sur trois modèles de langage : OpenAI GPT-OSS 120B, DeepSeek R1 670B et Moonshot AI Kimi K2.5 1T. Ces tests démontrent que la puce n'est pas uniquement optimisée pour les modèles d'OpenAI, mais qu'elle est capable de s'adapter à différentes charges de travail de grands modèles.

QQuels sont les avantages de la puce Jalapeño pour les charges de travail des agents IA interactifs ?

ALa puce Jalapeño est conçue pour optimiser les charges de travail des agents IA interactifs en réduisant considérablement la latence. Cela est crucial car les agents effectuent souvent une série d'étapes successives, et une faible latence à chaque étape évite l'accumulation de retards sur l'ensemble de la tâche, améliorant ainsi l'expérience utilisateur et l'efficacité.

QQuand OpenAI prévoit-il de déployer la puce Jalapeño et quelle est la feuille de route pour les générations futures ?

AOpenAI prévoit de commencer à déployer la puce Jalapeño dans ses infrastructures informatiques d'ici fin 2026. La deuxième génération (Gen 2) est déjà en développement avancé, et les conceptions de la troisième génération (Gen 3) sont en cours d'élaboration.

Lectures associées

Trading

Spot

Articles tendance

Comment acheter CHIP

Bienvenue sur HTX.com ! Nous vous permettons d'acheter USD.AI (CHIP) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément USD.AI (CHIP).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos USD.AI (CHIP)Après avoir acheté vos USD.AI (CHIP), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des USD.AI (CHIP)Tradez facilement USD.AI (CHIP) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

1.1k vues totalesPublié le 2026.04.21Mis à jour le 2026.06.02

Comment acheter CHIP

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de CHIP (CHIP) sont présentées ci-dessous.

活动图片