GPT-5.6 Sol devient soudainement stupide, le budget de réflexion passe de 960 à 128 ? Plus de modèle à intelligence fixe ?

marsbitPublished on 2026-07-15Last updated on 2026-07-15

Abstract

Réveil brutal pour les utilisateurs de GPT-5.6 Sol. Une équipe japonaise et de nombreux utilisateurs sur les réseaux sociaux ont rapporté que le modèle, en particulier le niveau de raisonnement « Max », semblait avoir considérablement perdu en profondeur d'analyse et en capacités de raisonnement complexe. Les réponses arrivent plus vite, mais sont moins élaborées. La communauté a mis en lumière un paramètre interne non documenté par OpenAI : la « juice value ». Il s'agirait du budget de ressources de calcul alloué au raisonnement. Des captures d'écran montrent que cette valeur pour le mode « Max » serait passée de 960 à 128, soit une baisse d'environ 87%. Face à la polémique, Thibault Sottiaux (Tibo) d'OpenAI a répondu qu'il n'y avait pas eu de « nerf » (affaiblissement) du modèle. Il explique que des expériences ont été menées pour analyser une consommation de tokens plus élevée que prévue suite aux nouvelles fonctionnalités de GPT-5.6. Ces tests ont temporairement ajusté l'« effort de raisonnement » (juice values) et réduit la fenêtre de contexte, désormais revenue à 272k tokens. Ces paramètres ont depuis été rétablis. L'incident révèle une tension fondamentale : la nécessité pour les fournisseurs de gérer les coûts de calcul colossaux de l'IA avancée, et l'attente des utilisateurs de bénéficier d'une puissance de raisonnement stable et prévisible. Comme le note l'article, s'abonner à un modèle aujourd'hui, c'est un peu comme acheter une ampoule dont l'intensité est cont...

Tout le monde sur Internet dit que le niveau Max de GPT-5.6 Sol est devenu plus stupide, OpenAI insiste sur le fait qu'il n'y a pas eu de réduction d'intelligence, juste "une expérience". Dans cette expérience, le bouton ajusté, le niveau Max est passé de 960 à 128, invisible pour l'utilisateur.

En se réveillant, GPT-5.6 Sol est devenu stupide !

Une équipe japonaise d'études de marché, peu après le début de leur journée de travail, a remarqué que leur Codex Sol MAX ne fonctionnait pas comme d'habitude. Le chef d'équipe a écrit un long post sur son expérience du matin et l'a posté sur r/codex de Reddit.

À 9h du matin, l'équipe a commencé comme d'habitude. Vers 10h40, chaque membre a remarqué la même chose.

Ils avaient branché Codex Sol MAX sur un outil CLI développé en interne, spécialisé dans des tâches nécessitant des calculs extrêmement complexes et un raisonnement profond.

Au début, Codex Sol MAX était à la hauteur des attentes, si on lui demandait un niveau 10, il livrait constamment du 12, du 13, c'était un "monstre dépassant largement les attentes", "tout le monde en était incroyablement satisfait".

Mais ce matin-là, les performances de ce "monstre" ont soudainement chuté, tombant à 8.

La profondeur du raisonnement avait clairement été réduite.

Avant cela, Codex Sol MAX passait plus de dix minutes sur un prompt, essayant, raisonnant, appelant leurs outils de manière répétée, jusqu'à ce que le travail soit parfaitement réalisé.

Mais cette capacité avait "complètement disparu" ce matin-là.

Tout le monde sur Internet trouve qu'il est "devenu stupide"

L'expérience de cette équipe japonaise n'est qu'un exemple parmi les plaintes de la communauté Codex ces derniers jours.

Les plaintes sont très similaires : le modèle est effectivement devenu plus rapide, les réponses arrivent plus rapidement, mais il refuse d'approfondir. L'ancienne attitude consistant à d'abord étudier, puis agir, en se remettant en question pendant l'action, a disparu.

Une phrase d'un internaute sur X résume la sensation de tous :

Le niveau de raisonnement de tout le monde a été collectivement abaissé d'un cran - si vous utilisiez Extra High auparavant, vous devez maintenant le passer à Max pour retrouver la même puissance.

Ce changement est impossible à prouver pour l'utilisateur lambda.

Vous ne pouvez pas voir si les poids du modèle ont changé, ni la puissance de calcul que le serveur vous alloue.

Vous ne percevez que quatre choses : la rapidité de sa réponse, la longueur de sa réflexion, s'il se relit, s'il fait appel à d'autres agents pour travailler ensemble.

Tout cela sont des signaux indirects, rien n'est écrit sur la fiche technique du modèle.

Ainsi, des membres de la communauté ont cherché par eux-mêmes et ont découvert un paramètre interne qu'OpenAI n'a jamais rendu public : la "juice value".

Un chiffre jamais mentionné officiellement

OpenAI n'a officiellement parlé que des niveaux de raisonnement.

Lors de la sortie de GPT-5.6 le 9 juillet, la formulation officielle était qu'il introduisait pour la première fois une intensité de raisonnement max, "permettant à Sol d'avoir suffisamment de temps pour un raisonnement en profondeur". Au-dessus, il y a ultra, qui lance par défaut quatre agents en parallèle.

Dans ChatGPT, cela se traduit par les options du sélecteur de modèle : Medium, High, Extra High, qui exécutent tous Sol en arrière-plan, le niveau Pro exécute Sol Pro.

La "juice value" est ce qui se cache sous ces niveaux : le budget interne de puissance de calcul pour le raisonnement. L'utilisateur ne le voit pas, et OpenAI n'a jamais publié ses valeurs.

L'utilisateur ns123abc a utilisé un prompt caché appelé "empreinte du modèle" pour lire dans la configuration système cette valeur : juice.

La communauté avait précédemment observé que le niveau max de Sol correspondait à 960. Cette fois, l'écran affichait 128, une baisse d'environ 87%.

Presque simultanément, un autre ensemble de captures d'écran a commencé à circuler : le contexte utilisable réellement par l'utilisateur dans le client Codex est passé d'environ 372k à 272k.

Ces deux chiffres ont rapidement enflammé toute la communauté.

Tibo : Pas de réduction d'intelligence, nous enquêtons sur la consommation

Le soir même, Tibo (Thibault Sottiaux) est intervenu. Il est responsable de Codex et ChatGPT Work chez OpenAI.

Tibo a posté une mise à jour sur X, commençant par dire : Pas de nerf (réduction d'intelligence), seulement de bonnes choses.

Puis, il a insisté sur quatre points d'un coup.

Premier point, l'optimisation de l'efficacité du raisonnement est en ligne, la puissance de calcul économisée est restituée à tous les abonnés, cela seul libère environ 10% d'utilisation supplémentaire.

Deuxième point, la limite de contexte de Sol a été augmentée de 272k (GPT-5.5) à 372k, ce qui a entraîné des frais plus élevés que prévu. C'est maintenant revenu à 272k, et 372k sera réintroduit dans les prochains jours.

Troisième point, pour comprendre d'où vient la consommation supplémentaire, l'équipe a mené des expériences, modifiant l'intensité du raisonnement (reasoning effort), appelée en interne "juice values".

C'est maintenant revenu à la normale.

Quatrième point, l'appel multi-agents sur les niveaux high et xhigh est plus élevé que prévu, et il y a du gaspillage du côté de l'auto-review, tout cela est en cours de correction.

Le post de Tibo revient à dire : Ce n'est pas une "réduction d'intelligence", c'est un "ajustement de paramètres".

Il n'a pas mentionné si les poids du modèle avaient été modifiés. Mais il a reconnu que la configuration effectivement reçue par l'utilisateur avait été modifiée.

Qu'est-ce que "juice" exactement ? D'après les informations publiques disponibles, cela semble plus proche d'un marqueur interne de configuration des ressources de raisonnement, grosso modo, la quantité de ressources de raisonnement que le système autorise le modèle à consacrer à une tâche.

Bien qu'une réduction du budget ne signifie pas "affaiblissement du modèle", cela peut changer discrètement beaucoup de choses :

Combien de chemins peuvent être explorés dans une tâche longue, combien de tours de comparaison entre plusieurs solutions, si du code généré exécutera activement des tests, combien de fois il acceptera de revenir en arrière après un échec, et cette petite partie des "capacités de longue traîne" qui font la différence dans les tâches extrêmement difficiles, etc.

En fin de compte, cela représente à quel point le modèle est prêt à réfléchir sur une tâche.

Pour mettre fin à ce débat, il faudrait une expérience rigoureusement contrôlée : un même instantané du modèle, un même lot de tâches, le même ensemble d'environnements d'outils, en ne modifiant que la variable "juice".

Pour voir à quel point le codage complexe, les agents de longue durée, le raisonnement mathématique et la récupération d'erreurs chuteraient.

Cette preuve est toujours absente à ce jour.

Chaque token économisé par le fournisseur, l'utilisateur le ressent

Revenons à cette expérience mentionnée par Tibo. Comment est-elle survenue ?

Après le lancement de GPT-5.6, la demande a explosé.

OpenAI a temporairement levé la limite d'utilisation de la fenêtre de cinq heures pour absorber l'afflux massif d'appels.

Et les nouveautés les plus marquantes de GPT-5.6 : une réflexion plus longue au niveau max, ultra lançant par défaut quatre agents en parallèle, une plus grande fenêtre de contexte, sont précisément des monstres dévoreurs de tokens.

La consommation supplémentaire provient précisément de là.

D'où cette expérience. Pour comprendre les comptes, baisser d'abord la variable du budget, voir où va la consommation, cela a parfaitement du sens d'un point de vue technique.

Mais le problème est là : les économies de tokens du côté du fournisseur sont perceptibles du côté de l'utilisateur, la plus évidente étant que le modèle "ne veut plus réfléchir".

La variable modifiée est justement celle que l'utilisateur peut sentir.

L'IA ne "fait plus de miracles", elle commence à pointer

Ces dernières années, les entreprises de grands modèles ont apporté une imagination quasi religieuse.

Les gens considéraient aussi les modèles comme des oracles, espérant qu'ils produisent une nuit une réponse à laquelle l'homme n'avait pas pensé, même si pour cela ils étaient un peu plus lents, plus chers, occasionnellement fous, on pouvait l'accepter.

Mais les miracles de laboratoire peuvent être sans limite de coût, ce n'est plus possible lorsqu'il s'agit d'infrastructures industrielles en production.

Ainsi, les modèles de pointe comme Sol commencent à passer d'un prophète faisant occasionnellement des "miracles" en laboratoire, à un moteur fonctionnant en continu dans les flux de travail quotidiens.

Derrière cela, il y a plus une domestication de l'intelligence, et cette controverse a exposé le processus en public. En même temps, l'illusion des utilisateurs sur une "intelligence fixe" va prendre fin.

S'abonner à un modèle, c'est plus comme acheter une ampoule : le modèle est fixe, mais le bouton de luminosité est toujours entre les mains de la plateforme.

Cela peut être un choix commercialement correct, mais il ne devrait pas rester à jamais caché dans une boîte noire.

Si l'IA doit vraiment devenir l'infrastructure des entreprises, les fournisseurs doivent donner des limites plus concrètes que le nom du modèle, pour que les utilisateurs comprennent ce qu'ils achètent avec leur Max, ce qui est garanti.

Sinon, ce n'est qu'une étiquette de prix.

Références :

https://x.com/thsottiaux/status/2076495156757577895

https://x.com/FixlationAI/status/2076469274441380349

https://www.reddit.com/r/codex/comments/1uuy5eq/nerfed_codex_sol_max/

Cet article provient du compte WeChat public "新智元", auteur : 元宇

Trending Cryptos

Related Questions

QQu'est-ce qui a conduit à la perception que GPT-5.6 Sol est devenu moins performant, selon les utilisateurs ?

ALes utilisateurs ont rapporté que GPT-5.6 Sol, en particulier le niveau 'Max', semblait effectuer des raisonnements moins profonds et fournissait des réponses plus rapidement mais avec une qualité réduite dans les tâches complexes de calcul et de raisonnement. Ils ont noté une diminution du temps consacré à l'exploration et à l'autocorrection.

QQu'est-ce que la valeur 'juice value' mentionnée dans l'article, et quel changement a été observé ?

ALa 'juice value' est un paramètre interne non documenté par OpenAI, qui semble représenter le budget de ressources de calcul alloué au raisonnement du modèle. La communauté a observé que cette valeur pour le niveau 'Max' de Sol était passée de 960 à 128, soit une réduction d'environ 87%.

QComment OpenAI, via Tibo, a-t-il répondu aux allégations de perte de performance de GPT-5.6 Sol ?

ATibo (Thibault Sottiaux) d'OpenAI a déclaré qu'il n'y avait pas eu de 'nerf' (réduction de performance), mais qu'une expérience avait été menée pour analyser la consommation des ressources. Pendant cette expérience, le paramètre interne 'juice values' (intensité de raisonnement) a été ajusté. Il a affirmé que les valeurs avaient été rétablies et a expliqué les ajustements techniques en cours.

QQuel est l'un des principaux compromis évoqués dans l'article entre l'optimisation des coûts par OpenAI et l'expérience utilisateur ?

AL'article souligne le compromis entre l'optimisation des coûts pour OpenAI (en réduisant la consommation de tokens/ressources) et la perception des utilisateurs d'un modèle qui 'réfléchit moins'. Les ajustements pour économiser des tokens peuvent directement affecter la profondeur et la qualité du raisonnement perçues par l'utilisateur.

QSelon la conclusion de l'article, quelle comparaison est faite concernant la relation entre l'utilisateur et le modèle d'IA ?

AL'article conclut en comparant l'abonnement à un modèle d'IA à l'achat d'une ampoule : bien que le modèle soit fixe, le 'bouton de luminosité' (c'est-à-dire l'allocation des ressources et la performance réelle) reste entre les mains de la plateforme. Cela met fin à l'illusion d'une 'intelligence fixe' et souligne le manque de transparence sur les garanties de performance pour les niveaux de service payants.

Related Reads

He Let GPT-5.6 Sol Run for 33 Hours Straight to Tackle Fermat's Last Theorem, Forcibly Terminated by the System

This article discusses a real-world experiment by expert Michael P. Frank to test if an AI, specifically GPT-5.6 Sol, could autonomously make progress on a major unsolved mathematical problem: finding a simpler proof for Fermat's Last Theorem. The AI was tasked with exploring specific mathematical pathways and maintaining rigorous notes over approximately 33 hours. However, the session was terminated by OpenAI's systems. The AI itself suggested two possible reasons for the stoppage: excessive resource consumption, or OpenAI having previously failed on similar problems and wishing to conserve computational resources. The AI reported its work primarily involved refining plausible ideas into precise, verifiable statements, most of which were subsequently disproven or excluded—effectively creating a map of dead ends rather than a proof. The incident sparked debate online. Some speculated that OpenAI might deliberately restrict public access to its most powerful models to maintain a competitive edge or avoid regulatory scrutiny, rather than allowing users to potentially solve landmark problems. OpenAI researcher Noam Brown countered this, arguing that a user solving a major problem would be tremendous publicity. Others offered technical explanations, suggesting the termination could be due to standard safety mechanisms preventing infinite loops, or even a known bug in the GPT-5.6 Sol version that disrupts long-running sessions. The story highlights the practical challenges, technical limits, and broader strategic questions surrounding the use of advanced AI for open-ended, high-stakes research.

marsbit33m ago

He Let GPT-5.6 Sol Run for 33 Hours Straight to Tackle Fermat's Last Theorem, Forcibly Terminated by the System

marsbit33m ago

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of SOL (SOL) are presented below.

活动图片