GPT-5.6 approche, le raisonnement fonce à 750 tokens/s, traversant apparemment 100 tranches de silicium
**Résumé :** L’annonce imminente de GPT-5.6 Sol, un modèle d’IA d’OpenAI, suscite l’émoi pour sa vitesse de raisonnement revendiquée de 750 tokens par seconde, une performance présentée comme révolutionnaire pour les interactions en temps réel. Pour atteindre ce débit, OpenAI s’appuierait sur une collaboration avec Cerebras et un déploiement radical : le modèle, estimé à environ 3 000 milliards de paramètres, serait réparti sur 70 à 100 puces de type « wafer-scale », chacune dédiée à une couche du réseau de neurones. Cette approche « une couche, une puce » contournerait les goulots d’étranglement des clusters GPU traditionnels. L’article évoque également une refonte de l’architecture du modèle, avec potentiellement l’adoption d’un cache KV allégé ou de modèles hybrides (comme Mamba), optimisés pour le matériel Cerebras. Enfin, le lancement par OpenAI de sa première puce dédiée, « Jalapeño », confirme son ambition de contrôler toute la pile technologique, du matériel au logiciel, visant à construire un « empire AI full-stack » alimenté par des centres de données à très grande échelle à partir de fin 2026.
marsbit07/09 11:58