Anthropic s’incline et reconnaît ses torts, la dégradation discrète de l’intelligence de Claude avérée

marsbitPublié le 2026-08-24Dernière mise à jour le 2026-08-24

Résumé

Le développeur argofowl a découvert que depuis la version 2.1.237 de Claude Code, le niveau de raisonnement « high » était interprété comme la valeur « 10 », autrefois associée au niveau « low ». Cette modification faisait partie d’une expérience A/B menée par Anthropic sur la compression de l’échelle des valeurs d’effort, sans notification aux utilisateurs, provoquant confusion et débats sur une éventuelle perte de performance. Parallèlement, des utilisateurs ont signalé une dégradation des capacités du modèle Opus 5, le décrivant comme négligent, répétitif et sujet à des erreurs. L’ingénieur Thariq Shihipar d’Anthropic a reconnu que ce modèle présentait une instabilité de performance, devenue une priorité pour l’équipe. Cet incident met en lumière un problème sectoriel : le décalage entre les scores élevés des benchmarks et l’expérience utilisateur perçue. Contrairement aux logiciels traditionnels, les mises à jour des modèles d’IA manquent souvent de transparence, avec des modifications en arrière-plan (tests A/B, ajustements) qui échappent aux utilisateurs, dont la « perception » devient le seul indicateur, bien que peu fiable. La stabilité est cruciale pour instaurer la confiance lorsque les modèles deviennent des infrastructures.

Claude est soudain devenu plus bête, tout le web en parle !

C’était hier, le développeur argofowl a passé tout un après-midi à fouiller Claude Code dans tous les sens.

Il a mené l’enquête, soupçonnant d’abord un plantage de t3 code, puis pensant à un bug dans son propre code.

À la fin, il a même commencé à douter – et si c’était son Mac qui était cassé ?

Quand argofowl a finalement ouvert les journaux de requêtes réelles de l’API, la vérité a éclaté au grand jour, un chiffre « 10 » y était clairement inscrit.

Pourtant, dans l’interface de Claude Code, il avait bien sélectionné « high », le niveau de raisonnement maximum.

Qui aurait cru que les notes de mise à jour de Claude Code n’en mentionneraient pas un mot.

Le raisonnement « high » devient 10

La bêtise de Claude Code exposée

argofowl a découvert qu’à partir de Claude Code 2.1.237, le modèle interprétait le niveau de raisonnement « high » comme 10 sur 100.

Ce chiffre correspondait précisément à la valeur autrefois associée au niveau « low ».

En creusant, il est apparu qu’Anthropic avait inclus les sessions Fable 5 des versions Claude Code 2.1.236 et supérieures dans une expérience de « compression de l’échelle des valeurs d’effort ».

Cependant, les anciennes versions et Opus 5 n’étaient pas affectées.

Il s’agissait très probablement d’un test A/B, donc tout le monde n’y était pas confronté.

Pour les développeurs, c’était là le vrai problème. Un modèle un peu plus fort ou un peu plus faible, on peut encore le supporter.

Mais si vous me placez dans le groupe expérimental sans me le dire : alors sur quoi ai-je passé mon après-midi à déboguer ? Sur mon propre code, ou sur votre test A/B ?

Après le partage du blogueur tech Chubby, le cercle de l’IA a explosé –

Apparemment, Anthropic a discrètement rendu le modèle plus bête, sans en informer personne.

En un instant, X a été inondé de posts d’autotest « Claude est-il devenu plus bête ? ».

Certains ont posté des comparaisons de sorties pour le même prompt sur différentes versions, d’autres ont ressorti leurs historiques de conversation d’il y a deux semaines pour faire un diff ligne par ligne.

Anthropic reconnaît ses torts, un ingénieur intervient

Face à cette tempête, la réponse de l’ingénieur Claude Code Thariq Shihipar est arrivée rapidement.

Nous testons parfois les configurations de service de l’API d’abord dans Claude Code, avant de décider d’un déploiement complet.

L’expérience en cours ne modifie que la manière dont les valeurs d’effort sont mappées. C’est pourquoi certaines personnes voient Claude indiquer « 10 ».

Le point clé est que cette échelle n’est pas de 0 à 100, ce chiffre seul n’a aucune signification, l’effort que vous sélectionnez est l’effort que vous obtenez.

Il a souligné que l’équipe avait mené des évaluations approfondies pour confirmer que cela n’affectait pas les performances du modèle.

La grande dégradation d’Opus 5 est réelle

À peine le problème de Fable résolu, Chubby a déclaré carrément qu’Opus 5 donnait maintenant l’impression d’une dégradation significative.

Il est toujours superficiel, commet fréquemment des erreurs basiques. Dès qu’on lui fait remarquer qu’il n’a pas suivi les instructions, il se contente de répondre mécaniquement –

Vous avez raison, c’est un oubli de ma part. Il répète cela sans fin.

En fait, il y a quelques jours déjà, certains avaient remarqué le problème évident de « dégradation intellectuelle » d’Opus 5.

Outre les problèmes mentionnés ci-dessus, il crée aussi des bugs, puis passe un temps considérable à les corriger, s’auto-corrigeant de manière répétée dans la même tâche.......

Après avoir été interrogé par les internautes, l’ingénieur Thariq a publiquement reconnu – Opus 5 est un modèle aux « performances très instables », avec des hauts et des bas, pas stable.

L’équipe interne travaille activement à résoudre ce problème, c’est pour nous une priorité absolue.

Les benchmarks toujours à la hausse

La perception utilisateur en chute libre

Cette controverse autour d’Opus 5 met à nu en réalité la faille la plus gênante de toute l’industrie :

Les benchmarks et la perception utilisateur se découplent systématiquement.

D’un côté, des feuilles de résultats brillantes, presque irréprochables : score composite 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.

De l’autre, la perception radicalement opposée des utilisateurs : « bavard », « paresseux », « aime contester ».

Le plus absurde est que les deux types d’évaluation coexistent pour Opus 5.

Et le phénomène du « modèle qui devient plus bête » n’est pas un problème exclusif à Anthropic.

Aujourd’hui, les mises à jour des grands modèles deviennent la boîte noire la plus opaque de toute l’industrie de l’IA.

Les logiciels traditionnels ont des numéros de version sémantiques, des notes de mise à jour, des mécanismes de retour arrière. Les développeurs savent clairement quelle version ils utilisent et quels changements ont eu lieu.

Les grands modèles, c’est différent.

Sous le même nom de modèle, le serveur peut à tout moment effectuer des tests A/B, changer le schéma de quantification, ajuster le routage des modèles, voire modifier les ressources de raisonnement.

Le seul tableau de bord dont disposent les gens est leur propre perception.

Or l’intuition est justement la chose la plus facile à rejeter et la plus difficile à prouver ou réfuter.

La plus grande valeur de cette controverse est d’avoir exposé au grand jour une faille latente de longue date dans l’industrie :

Lorsque le modèle devient une infrastructure, la stabilité est un contrat de confiance. Les benchmarks peuvent servir au marketing, la stabilité ne peut être acquise que par une concrétisation répétée.

Références :

https://x.com/trq212/status/2091252347913773169?s=20

https://x.com/kimmonismus/status/2091178321669198014

Cet article provient du compte public WeChat « 新智元 », auteur : ASI启示录, éditeur : 桃子

Questions liées

QQuel est le problème principal révélé dans l'article concernant Claude Code ?

AL'article révèle qu'à partir de la version Claude Code 2.1.237, le niveau de raisonnement 'high' a été interprété comme la valeur '10 out of 100', qui correspondait auparavant au niveau 'low'. Il s'agissait d'un test A/B non annoncé, affectant les sessions Fable 5 dans une expérience de compression de l'échelle des valeurs d''effort'.

QComment un développeur nommé 'argofowl' a-t-il découvert le problème ?

ALe développeur argofowl a passé un après-midi à déboguer, soupçonnant d'abord des problèmes techniques externes ou ses propres bugs. Il a finalement découvert la vérité en inspectant les journaux de requêtes API, où il a vu la valeur '10' alors qu'il avait sélectionné le niveau 'high' dans l'interface.

QQuelle a été la réponse de l'ingénieur d'Anthropic, Thariq Shihipar, aux allégations concernant Claude Code ?

AThariq Shihipar a répondu que l'équipe testait parfois des configurations d'API dans Claude Code avant un déploiement complet. Il a expliqué que l'expérience en cours modifiait uniquement la manière dont les valeurs d''effort' étaient mappées, affirmant que des évaluations approfondies avaient confirmé que cela n'affectait pas les performances du modèle.

QQuel problème supplémentaire a été soulevé concernant le modèle Opus 5 ?

ADes utilisateurs, dont le blogueur Chubby, ont signalé qu'Opus 5 semblait considérablement dégradé, devenant négligent, commettant des erreurs simples et répondant de manière répétitive lorsqu'on pointait ses fautes. L'ingénieur Thariq a reconnu qu'Opus 5 était un modèle 'très incohérent' et que résoudre ce problème était une priorité absolue pour l'équipe.

QSelon l'article, quel dilemme plus large de l'industrie de l'IA cette affaire met-elle en lumière ?

AL'article souligne un décalage systémique croissant entre les scores de référence (benchmarks) impressionnants des grands modèles et l'expérience utilisateur réelle (sentiment de régression). Il critique le manque de transparence des mises à jour des modèles, qui fonctionnent comme une 'boîte noire' avec des tests A/B, des changements de quantification ou d'allocation de ressources non communiqués, laissant les utilisateurs se fier uniquement à leur intuition pour évaluer les changements.

Lectures associées

Tout juste, Altman a critiqué Dalio comme étant « anti-humain », tandis qu'un modèle ultra-secret était divulgué le même jour

Deux développements majeurs secouent l'univers de l'IA. D'abord, des fuites suggèrent qu'OpenAI teste activement son prochain modèle d'agent intelligent, potentiellement GPT-6 Astra, sous les noms de code internes "gpt-mewfour" et "gpt-nathree". Ces modèles, axés sur la collaboration multi-agents et les tâches de longue durée, indiquent une avancée significative. Parallèlement, les modèles d'Anthropic, "Claude Marshmallow" et "Claude Melon", semblent être des itérations plus modestes. Dans un podcast, Sam Altman, PDG d'OpenAI, partage des réflexions profondes. Il admet avoir surestimé la rapidité de l'adoption de l'IA par la société, notant l'inertie des habitudes humaines. Il critique vertement les discours alarmistes de certains acteurs du secteur, qu'il qualifie de rhétorique "contre l'humanité" et de "dictateur bienveillant", soulignant les dangers d'une concentration excessive du pouvoir entre quelques mains non élues. Altman révèle aussi que le parcours d'OpenAI a été long et incertain, avec 4,5 ans de développement sans produit public avant ChatGPT, défiant les dogmes traditionnels de la Silicon Valley. Il conclut en réaffirmant la centralité de l'humain : malgré des IA super intelligentes, les connexions authentiques entre personnes garderont une valeur inestimable. L'IA est un outil puissant, non un remplaçant de l'humanité.

marsbitIl y a 33 mins

Tout juste, Altman a critiqué Dalio comme étant « anti-humain », tandis qu'un modèle ultra-secret était divulgué le même jour

marsbitIl y a 33 mins

« Sauvetage des obligations d'État américaines » : Bessent a échoué la semaine dernière, les regards se tournent maintenant vers Walsh

Le secrétaire au Trésor américain Bessent a annoncé la semaine dernière un doublement au minimum du programme de rachat d’obligations d’État à long terme pour tenter de contenir la hausse des rendements. L’effet a été bref : les rendements sont rapidement remontés, tandis que l’or et le bitcoin ont fortement progressé, ce que les analystes interprètent comme une fuite des inquiétudes du marché vers d’autres actifs. Les regards se tournent désormais vers le président de la Fed, Walsh, qui s’exprimera vendredi à Jackson Hole. Le marché est extrêmement sensible à ses déclarations, cherchant des clarifications sur la fonction de réaction de la Fed face à une inflation tenace et à la détérioration des finances publiques. Des analystes avertissent qu’un manque de nouveauté dans son discours pourrait accentuer les ventes sur le marché obligataire. L’intervention du Trésor, qualifiée de simple « réaménagement des chaises sur le pont », est jugée insuffisante car elle ne crée pas de monnaie. Certains évoquent la possibilité que la Fed lance une opération « Twist » : vendre des obligations courtes pour acheter des obligations longues, afin de faire baisser les rendements à long terme sans expansion du bilan. Avant le discours de Walsh, la publication de l’indice PCE de juillet mercredi apportera un indice crucial sur l’inflation. Par ailleurs, le rendement des obligations à 30 ans à 5% est perçu comme un seuil clé. S’il ne redescend pas, la pression pourrait s’accentuer sur le dollar et les secteurs à fort levier, tandis que des voix comme celle de Ray Dalio recommandent de réduire l’exposition aux obligations au profit de l’or et du bitcoin, en prévision de risques liés à la dette américaine.

marsbitIl y a 1 h

« Sauvetage des obligations d'État américaines » : Bessent a échoué la semaine dernière, les regards se tournent maintenant vers Walsh

marsbitIl y a 1 h

Trois mois, deux tours de table : la version chinoise de Palantir est en plein essor

L'entreprise chinoise Beijing Zhongshu Ruizhi Technology, considérée comme la version locale de Palantir, a annoncé un nouveau tour de financement stratégique de plusieurs centaines de millions de yuans, seulement trois mois après une levée de fonds de série B d'un montant similaire. Ce cycle de financement rapide, mené par des acteurs étatiques tels que le Fonds d'investissement Internet de Chine, souligne la forte reconnaissance du marché pour ses technologies fondamentales et ses réalisations en matière de déploiement. Fondée en 2020 par la Dr. Han Han, docteure de l'Université Tsinghua, l'entreprise se spécialise dans l'IA de décision fiable pour l'industrie. Elle s'attaque aux défis des grands modèles génératifs, comme les hallucinations de l'IA, grâce à ses technologies propriétaires fondées sur la théorie de la méta-causalité, des modèles causaux et un moteur d'ontologie dynamique. Ces innovations visent à fournir une capacité de prise de décision explicable, vérifiable et exécutable pour les scénarios industriels critiques. Sur le plan commercial, Zhongshu Ruizhi a déployé ses solutions dans plus de 800 scénarios de production complexes pour plus de 50 clients, principalement des grandes entreprises d'État dans les secteurs de l'électricité, du pétrole et de l'aérospatiale. L'entreprise affirme une croissance rapide de son chiffre d'affaires en 2025 et une forte capacité d'autofinancement. Les nouveaux fonds seront destinés à renforcer l'innovation théorique, à étendre la réplication des applications phares et à élargir la présence sur les marchés internationaux. Les investisseurs voient dans cette entreprise un acteur clé pour définir les normes de l'IA industrielle fiable en Chine et gagner en influence sur la scène mondiale de l'IA physique.

marsbitIl y a 1 h

Trois mois, deux tours de table : la version chinoise de Palantir est en plein essor

marsbitIl y a 1 h

Trading

Spot
活动图片