
Le modèle d'entrée de gamme Luna a vu ses prix drastiquement réduits, passant de 1 $ à 0,2 $ par million de tokens en entrée, et de 6 $ à 1,2 $ par million de tokens en sortie.
Converti en RMB, cela équivaut à un prix d'entrée d'environ 6,8 yuans à 1,35 yuan, et un prix de sortie d'environ 40,6 yuans à 8,1 yuans.
Le modèle Terra, positionné comme "outil de travail quotidien principal", a également baissé de 20%, avec des prix en entrée et sortie respectivement réduits à 2 $ et 12 $.
Converti en RMB, cela représente environ 13,5 yuans et 81,2 yuans.
Seul le modèle phare Sol maintient son prix initial, mais lance un mode Rapide, avec une vitesse pouvant atteindre jusqu'à 2,5 fois celle du mode standard, sans supplément de prix.

Après que Codex a vigoureusement réinitialisé les quotas d'utilisation, les réductions de prix ont été immédiatement programmées. OpenAI, tu veux vraiment éliminer la concurrence...
La guerre des prix entre directement en phase de feu.
OpenAI explique que cette baisse de prix est due au fait que GPT-5.6 Sol a contribué à réduire ses propres coûts.
GPT-5.6 Sol a participé à ses propres améliorations, réalisant des gains d'efficacité fulgurants, c'est pourquoi nous offrons ce retour aux utilisateurs nouveaux et anciens ~
Cette technique du pied gauche sur le pied droit pour s'élever, OpenAI, tu t'y es mis aussi.

.
Deux modèles en baisse de prix, un modèle accéléré
Désormais, les prix API des trois modèles GPT-5.6 sont les suivants :
GPT-5.6 Luna : 0,2 $ par million de tokens en entrée, 1,2 $ en sortie ;
GPT-5.6 Terra : 2 $ par million de tokens en entrée, 12 $ en sortie ;
GPT-5.6 Sol : 5 $ par million de tokens en entrée, 30 $ en sortie.

Après la baisse, Luna a effectué un véritable plongeon.
Son prix d'entrée est désormais au niveau du précédent GPT-5.4 nano, et son prix de sortie est même inférieur de 0,05 $.
Mais les tâches des deux modèles ne sont pas totalement identiques. GPT-5.4 nano est principalement orienté vers des tâches simples et fréquentes comme la classification, l'extraction d'informations et le tri.
GPT-5.6 Luna est quant à lui positionné par OpenAI comme un modèle destiné aux charges de travail sensibles aux coûts, capable d'appeler des outils, de traiter de longs contextes et d'exécuter des workflows en plusieurs étapes.
En résumé, OpenAI vend désormais un modèle capable de faire fonctionner des Agents au prix des anciens petits modèles simples.
Terra a été plus modéré, avec une baisse de 20%.
Sol maintient son prix initial mais ajoute un mode Rapide dont la vitesse peut atteindre jusqu'à 2,5 fois celle du mode standard, pour un prix double de celui du mode standard, sans changement du niveau d'intelligence du modèle.
Il remplacera également l'ancien "Priority Processing". Les requêtes API utilisant auparavant l'étiquette "priority" pourront automatiquement basculer vers le mode Rapide.
Selon l'annonce officielle, ces ajustements seront également appliqués à Codex et ChatGPT Work.
Les prix des abonnements ne diminueront pas, et le quota total des utilisateurs n'augmentera pas non plus, mais lors de l'utilisation de Terra et Luna, la consommation du quota sera proportionnellement réduite.
Pour le même montant d'abonnement, le modèle pourra effectuer plus de tâches.
OpenAI a également profité de l'occasion pour remplacer le modèle Auto-review dans ChatGPT et Codex CLI, passant de GPT-5.4 à GPT-5.6 Luna.
Auto-review est responsable de la vérification en arrière-plan du code et des résultats de modifications, une tâche typique d'Agent à haute fréquence.
En combinant la mise à niveau du modèle et la baisse de prix de Luna, OpenAI estime que son coût sera réduit d'environ un dixième.
Les modèles bon marché ne se contentent plus seulement de gérer les "tâches annexes" traditionnelles comme la classification et l'extraction, mais commencent à intervenir dans des processus nécessitant jugement et appels d'outils, tels que la revue de code et la surveillance en arrière-plan.
Actuellement, le positionnement des trois modèles est le suivant :
Confier les tâches sensibles au budget et à fort volume d'appels à Luna ;
Confier le travail quotidien ordinaire à Terra ;
Continuer à utiliser Sol pour les tâches difficiles ;
Si même l'attente est trop lente, payer le double pour la vitesse.
GPT-5.6 commence à participer à la réduction de ses propres coûts
Pourquoi cette baisse de prix soudaine ?
OpenAI explique que la raison est que GPT-5.6 Sol a participé à l'optimisation de son propre système de production.
Les gains d'efficacité qu'il a permis se sont traduits par des chiffres réduits sur la grille tarifaire.
Concrètement, GPT-5.6 Sol a réécrit et optimisé certains noyaux GPU de l'environnement de production, conçu et exécuté des centaines d'expériences de génération de tokens, et participé à la surveillance de l'entraînement, intervenant en cas de problème.
Les résultats sont également remarquables : l'optimisation des noyaux GPU de production a permis de réduire de 20% le coût du service de bout en bout de GPT-5.6 ; l'amélioration du décodage spéculatif a augmenté l'efficacité de génération des tokens de plus de 15%.

Les noyaux GPU peuvent être compris comme les programmes de bas niveau exécutant les tâches de calcul spécifiques du modèle sur le GPU.
Le modèle lui-même n'a pas besoin de changer. Il suffit que ces programmes soient écrits de manière plus efficace pour qu'un même GPU puisse effectuer les calculs plus rapidement, traiter plus de requêtes, et réduire ainsi le coût par appel.
Le décodage spéculatif consiste, lors de la génération d'une réponse, à "deviner" par lots les tokens susceptibles d'apparaître ensuite, puis à les soumettre au modèle principal pour vérification. Plus la prédiction est précise, moins il y a d'étapes de génération et d'attente une par une.
Ces deux optimisations n'ont pas réduit les capacités du modèle, mais permettent au même modèle de fonctionner plus vite et à moindre coût.
Cependant, il ne s'agit pas encore d'une mise à niveau totalement autonome de GPT-5.6 par lui-même.
OpenAI souligne spécifiquement que l'ensemble du processus reste dirigé par des humains.
Le modèle peut écrire du code, exécuter des expériences, surveiller les anomalies, mais la définition des objectifs, l'acceptabilité des résultats, l'intégration du code en environnement de production nécessitent toujours une « boucle humaine » (Human in the Loop).
OMT (One More Thing)
Enfin, il y a un autre changement nouveau.
Cette baisse de prix a un impact très précis : les workflows d'Agent.
Luna, dont la réduction est la plus forte, n'est pas seulement un petit modèle traditionnel utilisé pour la classification et l'extraction.
Selon le positionnement d'OpenAI, il peut appeler des outils et exécuter des tâches en plusieurs étapes, ciblant principalement les charges de travail à haute fréquence et sensibles aux coûts.
Ainsi, la baisse de 80% de Luna vise également à abaisser le seuil d'exécution à long terme des Agents.
Elle permet aux tâches de revue, de validation et de surveillance, qui étaient trop coûteuses pour être exécutées fréquemment, de devenir potentiellement des étapes régulières dans les workflows.
En combinant cela avec la participation de GPT-5.6 à l'optimisation de son propre système de production, un nouveau cycle apparaît :
Le modèle participe à l'amélioration de l'efficacité opérationnelle, réduisant les coûts ; après la baisse des prix, le modèle entre dans davantage de workflows à haute fréquence ; l'augmentation de l'échelle des appels favorise à son tour le prochain cycle d'optimisation de l'efficacité.
Cette roue de la réduction de prix (Flywheel) d'OpenAI commence déjà à prendre forme.
Après toute cette série d'opérations, la pression est désormais directement sur A-she (Anthropic ?) :
« À ton tour. »

Liens de référence :[1]https://x.com/OpenAI/status/2082878156483219672[2]https://x.com/sama/status/2082880720989532597
Cet article provient du compte WeChat officiel "Quantum Bit", auteur : Suivi des technologies de pointe







