
Si aujourd'hui il y a encore des gens qui dépensent le plus d'argent pour appeler le modèle le plus puissant d'OpenAI.
OpenAI leur conseillerait plutôt d'en changer.
Le 30 juillet, OpenAI a publié une annonce d'ajustement de prix.
Le modèle GPT-5.6 Luna a baissé de 80 %, le modèle Terra de 20 %.
Face à cette nouvelle, il est facile de se concentrer sur le fait que la Silicon Valley commence une guerre des prix.
Mais si l'on examine attentivement la documentation technique et le guide d'appel API publiés officiellement, on se rend compte que le véritable mouvement méritant l'attention ne réside pas dans les chiffres de prix eux-mêmes.
Il s'agit essentiellement de la première fois qu'OpenAI commence à dire aux utilisateurs que pour de nombreuses tâches, le modèle le plus fort n'est en réalité pas nécessaire.
L'entreprise a donné une recommandation très concrète. Pour une tâche complexe, utiliser d'abord GPT-5.6 Sol pour l'analyse des besoins et la conception de la solution, puis confier l'exécution, l'écriture du code et les tests à Luna.
Le modèle le plus cher est responsable de la réflexion, le moins cher du travail. Cette stratégie, il y a deux ans, équivalait à un déni commercial de soi.
Il faut savoir que par le passé, toute l'industrie de l'IA s'efforçait de dire au marché que son modèle était le plus intelligent.
Aujourd'hui, OpenAI se lève pour dire qu'il n'est pas toujours nécessaire d'acheter le plus cher.
Cela est bien plus important que la baisse des prix.
一、La complicité des deux géants de la Silicon Valley
Regardons d'abord ce qui s'est passé ces deux dernières semaines.
Le 30 juillet, OpenAI ajuste ses prix. Luna baisse de 80 %. Terra baisse de 20 %. Sol ne baisse pas, mais ajoute un mode Fast, pouvant être jusqu'à 2,5 fois plus rapide que le mode standard, au double du prix, mais avec une intelligence exactement identique.
Le modèle haut de gamme reste en place. Ce qui commence vraiment à générer du volume, ce sont les modèles d'entrée et de milieu de gamme.
Une semaine plus tôt.
Le 24 juillet, Anthropic a fait presque la même chose. Claude Opus 5 est sorti, avec un coût de 5 dollars pour un million de tokens en entrée, 25 dollars en sortie. Exactement la moitié du prix de Fable 5.
Plutôt qu'une avancée en performance, Anthropic insiste davantage sur son aspect économique : pour la moitié du prix, on obtient une capacité de raisonnement de pointe quasi-identique à celle de Fable 5.
Il y a seulement un mois, Fable 5 était encore le produit phare mis en avant par Anthropic. Le raisonnement le plus puissant, le contexte le plus long, le prix le plus élevé. Un mois plus tard, Anthropic trouve elle-même un substitut à moitié prix à son produit phare.
Si une seule entreprise faisait cela, on pourrait le comprendre comme un ajustement produit. Mais deux presque simultanément, ce n'est pas une coïncidence.
Elles ont toutes deux commencé à réduire activement l'importance des modèles phares.
二、Le phare assure la représentation, le volume fait gagner de l'argent
J'ai longtemps réfléchi par la suite : pourquoi précisément maintenant ?
La réponse n'est en réalité pas compliquée.
Dans le passé, la plus grande valeur des modèles phares n'était pas de gagner de l'argent, mais de prouver une avance technologique. Après la sortie de GPT-4, la valorisation d'OpenAI n'a cessé d'augmenter. À chaque mise à jour de Claude, Anthropic redéfinissait sa position technologique. Les modèles phares portaient la valeur de marque.
Mais les entreprises dépensent vraiment leur argent ailleurs.
Une entreprise exécute plusieurs millions d'appels API par jour. Le service client, la recherche, les approbations, la génération de code, l'exécution d'agents : ces tâches à haute fréquence représentent l'essentiel de la consommation de tokens. Ce qui intéresse le plus les acheteurs d'entreprise, ce n'est pas d'être premier au benchmark, c'est le coût par tâche, la stabilité, le ROI.
Lorsque l'échelle des appels atteint des dizaines de millions par jour, le léger avantage d'intelligence des modèles phares est instantanément effacé par l'énorme dépense en puissance de calcul.
L'action et la prise de position d'OpenAI marquent un tournant : les modèles phares de pointe ne sont plus chargés de gagner de l'argent.
三、L'IA entre dans l'ère des "véhicules grand public"
Cette scène, l'industrie automobile l'a déjà vécue.
Il y a vingt ans, la Série 7 définissait le haut de gamme BMW, la Classe S portait l'image de luxe Mercedes, l'A8 établissait l'image du haut de gamme Audi ; les modèles phares déterminaient la limite supérieure de la marque. Mais ce qui soutenait vraiment les ventes et les bénéfices, c'était toujours la Série 3 BMW, la Classe C Mercedes et l'A4 Audi.
C'est encore plus évident plus tard. La Model S a prouvé que Tesla savait construire des voitures. Ce qui en a fait un constructeur mondial, ce sont la Model 3 et la Model Y.
Le haut de gamme prouve les capacités, les modèles grand public gèrent l'échelle.
L'IA entre aujourd'hui aussi dans cette phase. Sol, Fable continueront d'exister, ils seront chargés de repousser les limites technologiques, de rafraîchir les benchmarks. Ceux qui assumeront vraiment la commercialisation deviendront de plus en plus Luna, Terra, Opus.
OpenAI a même publiquement écrit ce processus recommandé : Sol responsable de la planification, Luna responsable de l'exécution.
Ce n'est déjà plus un modèle unique, OpenAI conçoit un système de division du travail entre modèles. À l'avenir, ce que les entreprises achèteront ne sera pas un seul modèle, mais tout un ensemble de modèles. Ce qui déterminera vraiment le coût, ce n'est pas l'architecte en chef, mais les équipes d'exécution qui travaillent chaque jour.
四、Les modèles commencent à optimiser les modèles
Il y a un autre détail, que je trouve plus intéressant que la baisse de prix elle-même.
OpenAI mentionne dans ses spécifications techniques que cette baisse de prix n'est pas seulement due à l'achat de plus de GPU, ni à l'augmentation de l'échelle. La véritable raison, c'est que les modèles commencent à participer à l'optimisation des modèles.
Plus précisément, sous la direction d'ingénieurs humains, Sol a réécrit et optimisé de manière autonome le noyau de production sous-jacent. Il a lui-même conçu des centaines d'expériences pour améliorer l'efficacité de génération des tokens, et a même participé à la surveillance des processus d'entraînement des modèles, intervenant directement après la détection de problèmes.
Résultat : les coûts d'exécution de bout en bout ont baissé de 20 %, et l'efficacité de génération des tokens a augmenté de 15 %.
Cette information est facile à négliger, mais sa signification est grande.
Par le passé, l'amélioration de l'efficacité reposait sur les ingénieurs. Après la mise en ligne du modèle, les humains optimisaient petit à petit les frameworks d'inférence, CUDA, les stratégies de cache, les algorithmes d'ordonnancement. En un an, réussir à gagner quelques points de pourcentage d'efficacité était déjà bien.
Aujourd'hui, l'évolution technologique emprunte une nouvelle voie. Les modèles commencent à prendre en charge l'optimisation technique du code sous-jacent et de l'ordonnancement des ressources de calcul, en itérant en fonctionnement continu.
C'est un cycle qui va s'accélérer constamment. Plus les modèles sont intelligents, plus leur capacité à participer à l'optimisation est forte. Plus l'optimisation est rapide, plus la baisse des coûts est rapide. Plus les coûts sont bas, plus le volume d'appels est grand. Plus le volume d'appels est grand, plus de données sont générées, permettant de continuer à entraîner les modèles.
En parcourant l'évolution des prix d'OpenAI des deux dernières années et demie. GPT-4 à son lancement coûtait 30 dollars / million de tokens en entrée, GPT-4o est descendu à 5 dollars, GPT-4o mini est arrivé à 0,15 dollar. Aujourd'hui, le prix de Luna se situe dans la gamme bon marché des mini d'autrefois, mais son niveau d'intelligence global dépasse déjà largement celui du GPT-4 cher d'il y a deux ans.
En un peu plus de deux ans, le prix a chuté d'environ deux ordres de grandeur. Si les modèles continuent à s'optimiser eux-mêmes, cette courbe descendra probablement encore.
Ce qui est vraiment redoutable, ce n'est pas la baisse de 80 % d'aujourd'hui, c'est que la baisse des coûts commence à avoir une capacité d'auto-entraînement.
五、De "qui est le plus intelligent" à "qui en vaut le plus la peine"
Je pense de plus en plus que, aujourd'hui, lorsqu'on discute de la compétition en IA, on utilise parfois encore le cadre de la phase précédente.
Par exemple, on continue souvent à demander : Qui est le plus intelligent ? GPT, Claude, Gemini, DeepSeek. À chaque sortie d'un nouveau modèle, les médias regardent d'abord les classements. Qui est premier, qui gagne.
Pourtant, les nouvelles actions d'OpenAI et d'Anthropic brisent cette règle, elles transmettent un nouveau signal au marché : l'attrait des champions en performance individuelle est en train de s'estomper.
OpenAI mentionne une phrase dans son annonce que je trouve particulièrement clé, elle conseille aux développeurs de faire correspondre différents modèles selon l'importance de la tâche, le coût d'une erreur, l'urgence et l'échelle.
Remarquez, il ne discute plus du modèle, mais de la tâche.
Dans le passé, une entreprise déployant l'IA n'avait la plupart du temps qu'un seul choix. À partir d'aujourd'hui, cela ressemble davantage à la construction d'une organisation. Les tâches les plus importantes utilisent Sol, l'exécution quotidienne est confiée à Luna, il y aura peut-être à l'avenir des modèles encore plus légers pour des choses plus simples.
Cela ressemble beaucoup au cloud computing à l'époque. Personne ne place toutes ses données sur le SSD le plus cher. Les données chaudes vont sur SSD, les données ordinaires sur HDD, les données froides vont sur le stockage objet. On ne discute jamais de quel disque dur est le plus rapide, mais de comment construire l'ensemble du système de la manière la plus rentable.
DeepSeek a en réalité flairé cette direction plus tôt que la Silicon Valley. Ces six derniers mois, il n'a presque jamais insisté sur le fait qu'il était nécessairement le plus intelligent au monde, répétant seulement quelques mots : bon marché, assez rapide, suffisant.
Après un hit de cache, le coût par million de tokens devient presque négligeable. Il parie constamment sur une chose : ce dont les entreprises ont besoin n'est pas un champion du monde, mais l'option de déploiement avec le ROI global le plus élevé.
Il ne s'agit pas d'une guerre des prix à court terme, le suivi actuel des deux géants de la Silicon Valley valide l'inévitabilité de cette voie commerciale.
六、Ce qu'OpenAI veut vraiment vendre, ce ne sont pas des modèles
À ce jour, la stratégie d'OpenAI est claire : ce qu'elle veut vraiment vendre, ce ne sont plus des modèles, c'est du volume d'appels.
Par le passé, les fournisseurs de modèles dépendaient d'une prime technologique élevée pour obtenir une forte marge, maintenant la logique commerciale se transforme en échange d'un écosystème de trafic à très grande échelle avec un seuil d'entrée extrêmement bas.
Microsoft ne gagne vraiment de l'argent que parce que tous les ordinateurs sont équipés de Windows. AWS gagne de l'argent non pas parce que le profit par serveur est élevé, mais parce que chaque jour, d'innombrables applications tournent dessus dans le monde entier.
Les revenus d'une plateforme dépendent toujours de son taux de pénétration.
Cela explique pourquoi le prix de Sol n'a pas bougé. Sol porte la marque, il prouve qu'OpenAI reste l'entreprise à la limite technologique la plus élevée. Luna est le moteur des revenus.
OpenAI espère que les développeurs forment une nouvelle habitude par défaut : écrire des agents avec Luna, exécuter des workflows avec Luna, faire de l'exécution par lots avec Luna. Ce n'est que lorsqu'ils rencontrent un problème vraiment difficile qu'ils appellent Sol une fois.
Une fois cette habitude par défaut établie, la compétition ultérieure deviendra très difficile. La migration d'une entreprise vers un modèle sous-jacent différent implique de retester, valider, adapter tout le workflow. Les coûts de migration deviendront de plus en plus élevés.
Le véritable avantage concurrentiel commence déjà à passer d'une avance en capacité à une adhérence à l'écosystème.
七、Le modèle phare ne détermine plus la direction
En prenant du recul, l'industrie de l'IA traverse actuellement un point d'inflexion typique des économies d'échelle.
Lorsque le coût unitaire de la puissance de calcul descend très bas, la demande totale en tokens du marché ne diminue pas avec la baisse du prix unitaire, mais explose au contraire de manière exponentielle.
Le modèle phare ne détermine plus la direction, car le centre de gravité de l'évolution technologique s'est déplacé de l'exploration des limites de l'intelligence à la réduction des coûts industriels de la puissance de calcul. Lorsque le coût d'appel API est si bas qu'il devient négligeable, la forme et les frontières des modèles commenceront à s'estomper.
Les développeurs d'entreprise ne se préoccupent plus de la consommation de chaque token, mais intègrent l'IA de manière transparente dans chaque processus métier.
Le point le plus profond de cette transformation est que l'effondrement des prix des API augmente les coûts de migration de l'ensemble de l'ingénierie logicielle. Une fois que les workflows, les réseaux de planification d'agents et les pipelines d'automatisation des données d'une entreprise sont entièrement construits sur une combinaison de modèles à bas coût, le fournisseur du modèle sous-jacent verrouille le pipeline de calcul pour les dix prochaines années.
Ces dernières années, les entreprises de grands modèles vendaient de l'intelligence. À partir d'aujourd'hui, elles commencent à vendre de l'efficacité.
Ce sont deux histoires complètement différentes.
Note de la rédaction :
Par le passé, nous avions l'habitude de comparer le développement de l'IA à l'électronique grand public, espérant de temps en temps de nouveaux produits phares battant des records.
Mais peut-être que la véritable forme de victoire de l'IA n'est pas de devenir un produit sensationnel à un moment donné.
Lorsque la machine à vapeur a été inventée, les gens s'émerveillaient de sa productivité. Aujourd'hui, l'électricité circule partout, alimentant le fonctionnement de toute la civilisation, mais plus personne n'en discute spécifiquement.
Lorsque l'humanité ne discutera plus frénétiquement des performances intellectuelles qu'un nouveau modèle phare a encore battues, l'IA s'intégrera silencieusement dans chaque système, chaque instruction, devenant l'eau et l'électricité appelées par défaut derrière tous les processus automatisés.
C'est alors que son véritable ère commencera tout juste.
Cet article est issu du compte public WeChat "À côté de la mise en page", auteur : Huahua







