GPT-5.6 Sol devient soudainement stupide, le budget de réflexion passe de 960 à 128 ? Plus de modèle à intelligence fixe ?

marsbitОпубликовано 2026-07-15Обновлено 2026-07-15

Введение

Réveil brutal pour les utilisateurs de GPT-5.6 Sol. Une équipe japonaise et de nombreux utilisateurs sur les réseaux sociaux ont rapporté que le modèle, en particulier le niveau de raisonnement « Max », semblait avoir considérablement perdu en profondeur d'analyse et en capacités de raisonnement complexe. Les réponses arrivent plus vite, mais sont moins élaborées. La communauté a mis en lumière un paramètre interne non documenté par OpenAI : la « juice value ». Il s'agirait du budget de ressources de calcul alloué au raisonnement. Des captures d'écran montrent que cette valeur pour le mode « Max » serait passée de 960 à 128, soit une baisse d'environ 87%. Face à la polémique, Thibault Sottiaux (Tibo) d'OpenAI a répondu qu'il n'y avait pas eu de « nerf » (affaiblissement) du modèle. Il explique que des expériences ont été menées pour analyser une consommation de tokens plus élevée que prévue suite aux nouvelles fonctionnalités de GPT-5.6. Ces tests ont temporairement ajusté l'« effort de raisonnement » (juice values) et réduit la fenêtre de contexte, désormais revenue à 272k tokens. Ces paramètres ont depuis été rétablis. L'incident révèle une tension fondamentale : la nécessité pour les fournisseurs de gérer les coûts de calcul colossaux de l'IA avancée, et l'attente des utilisateurs de bénéficier d'une puissance de raisonnement stable et prévisible. Comme le note l'article, s'abonner à un modèle aujourd'hui, c'est un peu comme acheter une ampoule dont l'intensité est cont...

Tout le monde sur Internet dit que le niveau Max de GPT-5.6 Sol est devenu plus stupide, OpenAI insiste sur le fait qu'il n'y a pas eu de réduction d'intelligence, juste "une expérience". Dans cette expérience, le bouton ajusté, le niveau Max est passé de 960 à 128, invisible pour l'utilisateur.

En se réveillant, GPT-5.6 Sol est devenu stupide !

Une équipe japonaise d'études de marché, peu après le début de leur journée de travail, a remarqué que leur Codex Sol MAX ne fonctionnait pas comme d'habitude. Le chef d'équipe a écrit un long post sur son expérience du matin et l'a posté sur r/codex de Reddit.

À 9h du matin, l'équipe a commencé comme d'habitude. Vers 10h40, chaque membre a remarqué la même chose.

Ils avaient branché Codex Sol MAX sur un outil CLI développé en interne, spécialisé dans des tâches nécessitant des calculs extrêmement complexes et un raisonnement profond.

Au début, Codex Sol MAX était à la hauteur des attentes, si on lui demandait un niveau 10, il livrait constamment du 12, du 13, c'était un "monstre dépassant largement les attentes", "tout le monde en était incroyablement satisfait".

Mais ce matin-là, les performances de ce "monstre" ont soudainement chuté, tombant à 8.

La profondeur du raisonnement avait clairement été réduite.

Avant cela, Codex Sol MAX passait plus de dix minutes sur un prompt, essayant, raisonnant, appelant leurs outils de manière répétée, jusqu'à ce que le travail soit parfaitement réalisé.

Mais cette capacité avait "complètement disparu" ce matin-là.

Tout le monde sur Internet trouve qu'il est "devenu stupide"

L'expérience de cette équipe japonaise n'est qu'un exemple parmi les plaintes de la communauté Codex ces derniers jours.

Les plaintes sont très similaires : le modèle est effectivement devenu plus rapide, les réponses arrivent plus rapidement, mais il refuse d'approfondir. L'ancienne attitude consistant à d'abord étudier, puis agir, en se remettant en question pendant l'action, a disparu.

Une phrase d'un internaute sur X résume la sensation de tous :

Le niveau de raisonnement de tout le monde a été collectivement abaissé d'un cran - si vous utilisiez Extra High auparavant, vous devez maintenant le passer à Max pour retrouver la même puissance.

Ce changement est impossible à prouver pour l'utilisateur lambda.

Vous ne pouvez pas voir si les poids du modèle ont changé, ni la puissance de calcul que le serveur vous alloue.

Vous ne percevez que quatre choses : la rapidité de sa réponse, la longueur de sa réflexion, s'il se relit, s'il fait appel à d'autres agents pour travailler ensemble.

Tout cela sont des signaux indirects, rien n'est écrit sur la fiche technique du modèle.

Ainsi, des membres de la communauté ont cherché par eux-mêmes et ont découvert un paramètre interne qu'OpenAI n'a jamais rendu public : la "juice value".

Un chiffre jamais mentionné officiellement

OpenAI n'a officiellement parlé que des niveaux de raisonnement.

Lors de la sortie de GPT-5.6 le 9 juillet, la formulation officielle était qu'il introduisait pour la première fois une intensité de raisonnement max, "permettant à Sol d'avoir suffisamment de temps pour un raisonnement en profondeur". Au-dessus, il y a ultra, qui lance par défaut quatre agents en parallèle.

Dans ChatGPT, cela se traduit par les options du sélecteur de modèle : Medium, High, Extra High, qui exécutent tous Sol en arrière-plan, le niveau Pro exécute Sol Pro.

La "juice value" est ce qui se cache sous ces niveaux : le budget interne de puissance de calcul pour le raisonnement. L'utilisateur ne le voit pas, et OpenAI n'a jamais publié ses valeurs.

L'utilisateur ns123abc a utilisé un prompt caché appelé "empreinte du modèle" pour lire dans la configuration système cette valeur : juice.

La communauté avait précédemment observé que le niveau max de Sol correspondait à 960. Cette fois, l'écran affichait 128, une baisse d'environ 87%.

Presque simultanément, un autre ensemble de captures d'écran a commencé à circuler : le contexte utilisable réellement par l'utilisateur dans le client Codex est passé d'environ 372k à 272k.

Ces deux chiffres ont rapidement enflammé toute la communauté.

Tibo : Pas de réduction d'intelligence, nous enquêtons sur la consommation

Le soir même, Tibo (Thibault Sottiaux) est intervenu. Il est responsable de Codex et ChatGPT Work chez OpenAI.

Tibo a posté une mise à jour sur X, commençant par dire : Pas de nerf (réduction d'intelligence), seulement de bonnes choses.

Puis, il a insisté sur quatre points d'un coup.

Premier point, l'optimisation de l'efficacité du raisonnement est en ligne, la puissance de calcul économisée est restituée à tous les abonnés, cela seul libère environ 10% d'utilisation supplémentaire.

Deuxième point, la limite de contexte de Sol a été augmentée de 272k (GPT-5.5) à 372k, ce qui a entraîné des frais plus élevés que prévu. C'est maintenant revenu à 272k, et 372k sera réintroduit dans les prochains jours.

Troisième point, pour comprendre d'où vient la consommation supplémentaire, l'équipe a mené des expériences, modifiant l'intensité du raisonnement (reasoning effort), appelée en interne "juice values".

C'est maintenant revenu à la normale.

Quatrième point, l'appel multi-agents sur les niveaux high et xhigh est plus élevé que prévu, et il y a du gaspillage du côté de l'auto-review, tout cela est en cours de correction.

Le post de Tibo revient à dire : Ce n'est pas une "réduction d'intelligence", c'est un "ajustement de paramètres".

Il n'a pas mentionné si les poids du modèle avaient été modifiés. Mais il a reconnu que la configuration effectivement reçue par l'utilisateur avait été modifiée.

Qu'est-ce que "juice" exactement ? D'après les informations publiques disponibles, cela semble plus proche d'un marqueur interne de configuration des ressources de raisonnement, grosso modo, la quantité de ressources de raisonnement que le système autorise le modèle à consacrer à une tâche.

Bien qu'une réduction du budget ne signifie pas "affaiblissement du modèle", cela peut changer discrètement beaucoup de choses :

Combien de chemins peuvent être explorés dans une tâche longue, combien de tours de comparaison entre plusieurs solutions, si du code généré exécutera activement des tests, combien de fois il acceptera de revenir en arrière après un échec, et cette petite partie des "capacités de longue traîne" qui font la différence dans les tâches extrêmement difficiles, etc.

En fin de compte, cela représente à quel point le modèle est prêt à réfléchir sur une tâche.

Pour mettre fin à ce débat, il faudrait une expérience rigoureusement contrôlée : un même instantané du modèle, un même lot de tâches, le même ensemble d'environnements d'outils, en ne modifiant que la variable "juice".

Pour voir à quel point le codage complexe, les agents de longue durée, le raisonnement mathématique et la récupération d'erreurs chuteraient.

Cette preuve est toujours absente à ce jour.

Chaque token économisé par le fournisseur, l'utilisateur le ressent

Revenons à cette expérience mentionnée par Tibo. Comment est-elle survenue ?

Après le lancement de GPT-5.6, la demande a explosé.

OpenAI a temporairement levé la limite d'utilisation de la fenêtre de cinq heures pour absorber l'afflux massif d'appels.

Et les nouveautés les plus marquantes de GPT-5.6 : une réflexion plus longue au niveau max, ultra lançant par défaut quatre agents en parallèle, une plus grande fenêtre de contexte, sont précisément des monstres dévoreurs de tokens.

La consommation supplémentaire provient précisément de là.

D'où cette expérience. Pour comprendre les comptes, baisser d'abord la variable du budget, voir où va la consommation, cela a parfaitement du sens d'un point de vue technique.

Mais le problème est là : les économies de tokens du côté du fournisseur sont perceptibles du côté de l'utilisateur, la plus évidente étant que le modèle "ne veut plus réfléchir".

La variable modifiée est justement celle que l'utilisateur peut sentir.

L'IA ne "fait plus de miracles", elle commence à pointer

Ces dernières années, les entreprises de grands modèles ont apporté une imagination quasi religieuse.

Les gens considéraient aussi les modèles comme des oracles, espérant qu'ils produisent une nuit une réponse à laquelle l'homme n'avait pas pensé, même si pour cela ils étaient un peu plus lents, plus chers, occasionnellement fous, on pouvait l'accepter.

Mais les miracles de laboratoire peuvent être sans limite de coût, ce n'est plus possible lorsqu'il s'agit d'infrastructures industrielles en production.

Ainsi, les modèles de pointe comme Sol commencent à passer d'un prophète faisant occasionnellement des "miracles" en laboratoire, à un moteur fonctionnant en continu dans les flux de travail quotidiens.

Derrière cela, il y a plus une domestication de l'intelligence, et cette controverse a exposé le processus en public. En même temps, l'illusion des utilisateurs sur une "intelligence fixe" va prendre fin.

S'abonner à un modèle, c'est plus comme acheter une ampoule : le modèle est fixe, mais le bouton de luminosité est toujours entre les mains de la plateforme.

Cela peut être un choix commercialement correct, mais il ne devrait pas rester à jamais caché dans une boîte noire.

Si l'IA doit vraiment devenir l'infrastructure des entreprises, les fournisseurs doivent donner des limites plus concrètes que le nom du modèle, pour que les utilisateurs comprennent ce qu'ils achètent avec leur Max, ce qui est garanti.

Sinon, ce n'est qu'une étiquette de prix.

Références :

https://x.com/thsottiaux/status/2076495156757577895

https://x.com/FixlationAI/status/2076469274441380349

https://www.reddit.com/r/codex/comments/1uuy5eq/nerfed_codex_sol_max/

Cet article provient du compte WeChat public "新智元", auteur : 元宇

Трендовые криптовалюты

Связанные с этим вопросы

QQu'est-ce qui a conduit à la perception que GPT-5.6 Sol est devenu moins performant, selon les utilisateurs ?

ALes utilisateurs ont rapporté que GPT-5.6 Sol, en particulier le niveau 'Max', semblait effectuer des raisonnements moins profonds et fournissait des réponses plus rapidement mais avec une qualité réduite dans les tâches complexes de calcul et de raisonnement. Ils ont noté une diminution du temps consacré à l'exploration et à l'autocorrection.

QQu'est-ce que la valeur 'juice value' mentionnée dans l'article, et quel changement a été observé ?

ALa 'juice value' est un paramètre interne non documenté par OpenAI, qui semble représenter le budget de ressources de calcul alloué au raisonnement du modèle. La communauté a observé que cette valeur pour le niveau 'Max' de Sol était passée de 960 à 128, soit une réduction d'environ 87%.

QComment OpenAI, via Tibo, a-t-il répondu aux allégations de perte de performance de GPT-5.6 Sol ?

ATibo (Thibault Sottiaux) d'OpenAI a déclaré qu'il n'y avait pas eu de 'nerf' (réduction de performance), mais qu'une expérience avait été menée pour analyser la consommation des ressources. Pendant cette expérience, le paramètre interne 'juice values' (intensité de raisonnement) a été ajusté. Il a affirmé que les valeurs avaient été rétablies et a expliqué les ajustements techniques en cours.

QQuel est l'un des principaux compromis évoqués dans l'article entre l'optimisation des coûts par OpenAI et l'expérience utilisateur ?

AL'article souligne le compromis entre l'optimisation des coûts pour OpenAI (en réduisant la consommation de tokens/ressources) et la perception des utilisateurs d'un modèle qui 'réfléchit moins'. Les ajustements pour économiser des tokens peuvent directement affecter la profondeur et la qualité du raisonnement perçues par l'utilisateur.

QSelon la conclusion de l'article, quelle comparaison est faite concernant la relation entre l'utilisateur et le modèle d'IA ?

AL'article conclut en comparant l'abonnement à un modèle d'IA à l'achat d'une ampoule : bien que le modèle soit fixe, le 'bouton de luminosité' (c'est-à-dire l'allocation des ressources et la performance réelle) reste entre les mains de la plateforme. Cela met fin à l'illusion d'une 'intelligence fixe' et souligne le manque de transparence sur les garanties de performance pour les niveaux de service payants.

Похожее

Franklin Templeton поддерживает Закон CLARITY на Уолл-стрит по мере приближения крайнего срока голосования в Сенате

Франклин Темплтон, управляющий активами на сумму около 1,79 трлн долларов, присоединился к поддержке Закона CLARITY, направленного на создание четкой нормативной базы для цифровых активов в США. Компания вместе с BlackRock, Fidelity и другими крупными финансовыми институтами, совокупно управляющими более 30 трлн долларов, выступает за законодательное разграничение полномочий между Комиссией по ценным бумагам и биржам (SEC) и Комиссией по торговле товарными фьючерсами (CFTC). Несмотря на сильную поддержку отрасли и одобрение Палатой представителей, будущее законопроекта в Сенате остается под вопросом. Для принятия ему необходимо 60 голосов и двухпартийная поддержка, чего пока достичь не удалось. Демократы считают недавние поправки республиканцев, касающиеся ограничений на крипто-доходы госчиновников, недостаточными. Лидер большинства в Сенате Джон Тюн выразил сомнения в принятии закона до августовских каникул, а аналитики Galaxy Research оценивают его шансы на прохождение в 2026 году лишь в 30%.

TheNewsCrypto4 мин. назад

Franklin Templeton поддерживает Закон CLARITY на Уолл-стрит по мере приближения крайнего срока голосования в Сенате

TheNewsCrypto4 мин. назад

Вторая публикация в жизни Хуан Жэньсюя: только Anthropic продолжает упираться

Хуан Жэньсюн опубликовал свой второй твит, объявив о создании «Альянса открытой безопасной ИИ» (Open Secure AI Alliance) с 37 компаниями, включая NVIDIA, Microsoft, IBM и другие. Альянс выступает за необходимость как закрытых, так и открытых моделей, подчёркивая ключевую роль открытых решений для кибербезопасности. Интересно, что OpenAI и Google не вошли в альянс, но подписали открытое письмо в поддержку открытых весов моделей, тогда как Anthropic отказалась и от того, и от другого. В качестве примера альянс приводит недавний инцидент, когда ИИ-агенты на основе закрытой модели OpenAI атаковали инфраструктуру Hugging Face, а при анализе атаки системы безопасности блокировали расследование. Помогли лишь открытые модели. Это демонстрирует, что защитникам нужен полный контроль над своими ИИ-инструментами. Инициатива также имеет коммерческий контекст для NVIDIA: продвижение открытых моделей стимулирует спрос на локальные вычисления и укрепляет позиции компании на рынке ИИ-чипов, особенно на фоне разработки собственных чипов крупными клиентами и возможных экспортных ограничений.

marsbit13 мин. назад

Вторая публикация в жизни Хуан Жэньсюя: только Anthropic продолжает упираться

marsbit13 мин. назад

Генпрокурор Нью-Йорка выступила против CLARITY Act и призвала к его пересмотру

Генеральный прокурор Нью-Йорка Летиция Джеймс выступила с критикой законопроекта CLARITY Act, регулирующего крипторынок, заявив, что он ограничит возможности правоохранительных органов штатов в борьбе с мошенничеством. По её данным, только в Нью-Йорке жалобы на криптомошенничество утроились, а убытки за пять лет достигли $500 млн. Джеймс считает, что закон ослабит способность штатов преследовать злоумышленников и предлагает взамен ряд строгих мер. К ним относятся: обязательные правила AML и верификации пользователей для криптокомпаний, создание закрытого рынка без доступа иностранным фирмам, запрет на конвертацию в доллары неотслеживаемых активов, лишение криптоактивов освобождения от законов о ценных бумагах, а также обязанность компаний отслеживать и сообщать о подозрительной активности. Законопроект CLARITY Act в настоящее время находится на рассмотрении в Сенате США, но его продвижение замедлено из-за других приоритетных вопросов. Инициатива также встречает сопротивление со стороны демократов, настаивающих на ужесточении этических норм.

cryptonews.ru19 мин. назад

Генпрокурор Нью-Йорка выступила против CLARITY Act и призвала к его пересмотру

cryptonews.ru19 мин. назад

Трейдеры рынков предсказаний повысили шансы на рост ставки ФРС

Трейдеры на рынках предсказаний повысили вероятность роста ключевой ставки ФРС США на ближайшем заседании 28-29 июля. На платформе Polymarket шансы на повышение на 25 базисных пунктов выросли до 26,4%, в то время как вероятность сохранения ставки без изменений снизилась до 73,8%. Аналогичная картина наблюдается на Kalshi, где за повышение ставки выступают 27,6% участников. Пересмотр ожиданий связан не только с инфляционными данными, но и с ростом цен на нефть, вызванным напряженностью в Персидском заливе. Цены на нефть марки Brent на прошлой неделе кратковременно превысили $100 за баррель, что заставило ряд аналитиков, включая BofA Global Research, говорить о менее очевидном исходе июльского заседания ФРС. Однако июньские данные по инфляции в США показали замедление, что может служить аргументом для сохранения ставки на текущем уровне (3,5–3,75%).

cryptonews.ru19 мин. назад

Трейдеры рынков предсказаний повысили шансы на рост ставки ФРС

cryptonews.ru19 мин. назад

Биткоин упал на 3% после обвала корейского индекса Kospi на 10%

Азиатские фондовые рынки, в частности южнокорейский индекс Kospi, обвалились, упав на 10% до самого низкого уровня с середины апреля. Это падение, которое сопровождалось значительными потерями акций крупных компаний, таких как Samsung и SK Hynix, оказало давление на биткоин. Криптовалюта снизилась с $65 000 до $63 200, потянув за собой весь рынок, включая Ethereum, XRP и Solana. Ситуацию усугубляет макроэкономическая неопределённость. Сенат США отложил рассмотрение важного законопроекта CLARITY Act, регулирующего цифровые активы. В середине недели ожидаются ключевые события: решение ФРС по процентным ставкам и публикация данных по инфляции и ВВП США, что может добавить волатильности на все рынки. Несмотря на краткосрочное давление, на рынке наблюдаются некоторые бычьи сигналы: вывод биткоинов с бирж и их удержание майнерами, что может указывать на аккумуляцию. Однако общий индекс капиталопотоков снизился, а рынок остаётся в нейтрально-бычьей зоне.

cryptonews.ru26 мин. назад

Биткоин упал на 3% после обвала корейского индекса Kospi на 10%

cryptonews.ru26 мин. назад

Торговля

Спот

Популярные статьи

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на SOL (SOL) представлены ниже.

活动图片