Claude : Deux nouveaux modèles testés, une capacité de raisonnement spatial époustouflante qui épuise la puissance de calcul

marsbitPublié le 2026-08-25Dernière mise à jour le 2026-08-25

Résumé

Anthropic a discrètement testé deux nouveaux modèles, "Claude Marshmallow" et "Claude Melon", qui démontrent des capacités révolutionnaires en raisonnement spatial et 3D. Les tests révèlent que ces modèles excellent dans des tâches complexes comme la planification de l'aménagement d'un bâtiment ou l'apprentissage par renforcement 3D, produisant des résultats précis en une seule tentative (one-shot), sans nécessiter de corrections multiples. Une caractéristique frappante est leur consommation massive de "tokens de réflexion" (thinking tokens). Avant de fournir une réponse, les modèles effectuent des raisonnements logiques profonds en arrière-plan, utilisant parfois tellement de ressources de calcul qu'ils atteignent les limites maximales de tokens autorisées par le système. Cela marque un virage vers des IA capables d'une "pensée lente" et approfondie. Leur apparition, peu après le lancement mitigé d'Opus 5, alimente les spéculations. Ils pourraient être des versions améliorées (Opus 5.1) destinées à combler les lacunes du précédent modèle, ou de nouvelles itérations des gammes Sonnet ou Haiku. Quoi qu'il en soit, Anthropic accélère clairement son développement pour reprendre l'avantage dans la course à l'IA, avec des implications majeures pour la conception de jeux, l'architecture et les simulations numériques.

Les deux nouveaux modèles de Claude — Marshmallow et Melon — révélés hier font déjà l'objet de tests concrets aujourd'hui !

Des tests préliminaires montrent que les performances des deux modèles en apprentissage par renforcement 3D et en agencement spatial architectural sont tout simplement terrifiantes.

De plus, leur consommation en ressources de calcul est elle aussi démente.

Avant de fournir une réponse, ils consomment des quantités astronomiques de « tokens de réflexion » (Thinking Tokens) pour effectuer un raisonnement logique en profondeur, frôlant à plusieurs reprises la limite maximale autorisée par le système !

À travers ces modèles, Claude est en train d'évoluer vers une nouvelle génération de colosse de l'IA, capable d'une « réflexion lente » et d'un raisonnement spatial et physique profond.

Apprentissage par renforcement 3D et agencement architectural maîtrisés en un seul essai (One-Shot)

Un testeur a donné son avis : Anthropic avance à toute vitesse dans l'apprentissage par renforcement 3D.

Les agencements spatiaux de bâtiments sont incroyablement bons, et tout cela est généré en une seule fois (One-Shot) !

Il faut savoir que pour les LLM, l'imagination spatiale a toujours été un point faible mortel.

Faire comprendre à une IA les relations de coordonnées physiques entre une table et une chaise dans une pièce 3D, les lois de la gravité, ou planifier l'agencement d'un complexe architectural avec des circulations complexes et des structures porteuses, était jusqu'ici une tâche quasi impossible.

Mais cette fois, les modèles « Marshmallow » et « Melon » de Claude semblent avoir franchi ce fossé.

Ils peuvent directement comprendre et générer des coordonnées 3D et des relations spatiales complexes.

De plus, les tests montrent que leurs agencements architecturaux sont exceptionnels, ce qui indique que les nouveaux modèles sont également très performants pour traiter les contraintes topologiques, géométriques et physiques.

Et ils produisent cela en One-Shot, sans nécessiter de multiples ajustements des prompts par un humain pour corriger les erreurs. Après une réflexion interne approfondie, le modèle peut sortir des données de scène 3D parfaites en une seule fois.

Cette capacité cache une valeur commerciale et industrielle énorme.

Imaginez : à l'avenir, un développeur de jeux pourrait simplement décrire en langage naturel : « Génére-moi une forteresse de style médiéval avec trois tours de défense et un passage secret souterrain », et Claude pourrait directement produire le code du modèle 3D ou les paramètres d'agencement parfaits.

Un architecte pourrait demander à l'IA de générer des dizaines de propositions préliminaires d'agencements conformes à la mécanique des structures, en fonction du terrain et des conditions d'éclairage. La construction des métavers, des jumeaux numériques industriels, des environnements de simulation pour la conduite autonome...

Tout cela serait radicalement transformé par cette puissante capacité de génération 3D !

Le double coup de force de Marshmallow et Melon

Hier, tout Internet était inondé de posts sur Marshmallow et Melon.

Les deux modèles révélés portent les noms de code internes claude-marshmallow-eap (Marshmallow) et claude-melon-eap (Melon).

Cette convention de nommage « nourriture + EAP » poursuit la tradition établie en juillet dernier avec le modèle claude-horchata-eap (Horchata, une boisson mexicaine) brièvement testé.

D'où viennent donc ces deux modèles ?

D'après les données interceptées par un développeur dans les logs de trafic API, l'ID claude-marshmallow-ht-eap a été appelé à haute fréquence 57 fois entre 00:45 et 00:57Z le 21 août !

Peu après, il est apparu dans la liste des modèles de Claude Code sous l'intitulé « Custom model », avec une fenêtre de contexte ultra-longue atteignant 1 million de tokens.

Bien que ces deux modèles ne disposent pas encore de point d'accès API officiel et semblent réservés aux testeurs de l'équipe rouge (red team) ou au personnel interne clé, les retours des premiers tests sporadiques sont déjà explosifs.

Les capacités globales de « Marshmallow » sont considérées comme légèrement supérieures à celles de « Melon ».

Dans les conversations quotidiennes et les interactions logiques, l'expérience avec « Marshmallow » est même jugée meilleure que celle avec l'actuel Opus 5, la conversation paraissant plus naturelle et agréable.

Bien que leurs performances actuelles semblent encore inférieures au niveau suprême « Fable » d'Anthropic, sont-ils la fameuse version Opus 5.1 ? Sonnet 5.1 ? Ou une toute nouvelle itération de Haiku ?

Rien n'est encore certain.

Dévoreurs de puissance de calcul : les « tokens de réflexion » fous

Qui plus est, plusieurs testeurs ont découvert un phénomène extrêmement inhabituel : lors de leur utilisation, ces deux nouveaux modèles atteignent un niveau de consommation de ressources de calcul complètement dément !

Un testeur s'est exclamé sur X : « J'ai remarqué un point commun entre ces deux modèles : ils utilisent une quantité astronomique de tokens de réflexion, au point que pendant mes tests, j'ai plusieurs fois directement atteint la limite ! »

Qu'est-ce qu'un « token de réflexion » ? Pourquoi est-il si important ?

Dans les interactions passées avec les grands modèles, l'IA ressemblait souvent à un répondant « vif et prompt », générant instantanément une réponse mot à mot selon une distribution de probabilités.

La nouvelle génération de modèles de Claude change radicalement cette logique. Avant de fournir la réponse finale, le modèle génère en arrière-plan une grande quantité de tokens « invisibles », utilisés pour effectuer une auto-déduction extrêmement profonde, construire des chaînes de raisonnement et tester des logiques.

Cet investissement « sans compter » en puissance de calcul envoie un signal extrêmement fort : Anthropic est en train de s'attaquer en secret au goulet d'étranglement du raisonnement profond de l'IA !

Cela confirme également les suppositions antérieures dans le secteur — la compétition entre grands modèles se déplace de « l'empilement de puissance de calcul en phase d'entraînement » vers « la consommation de puissance de calcul en phase d'inférence ».

Lorsque Claude commence à « réfléchir » frénétiquement jusqu'à frôler les limites, la qualité des réponses qu'il produit constituera un avantage écrasant sur les modèles traditionnels.

Une intervention d'urgence ? La « bataille de la revanche » d'Opus 5

La fuite soudaine de ces deux modèles mystérieux intervient également à un moment crucial.

Il y a à peine un mois, le 24 juillet 2026, Anthropic a dévoilé son modèle phare très attendu, Opus 5.

Auparavant, Sonnet 5, sorti le 30 juin, avait été très bien accueilli.

Cependant, Opus 5 a essuyé un échec cuisant.

Un développeur s'est moqué sans pitié sur X : « Les critiques négatives sur Opus 5 sont si graves qu'Anthropic a dû sortir immédiatement deux nouveaux modèles pour essayer de le remplacer... Mort de rire. »

En effet, Opus 5 ne semble pas avoir répondu aux attentes d'une « amélioration intergénérationnelle ». Pour Anthropic, pressé d'aller vers une introduction en bourse, c'est sans aucun doute un revers majeur.

C'est pourquoi la révélation de « Marshmallow » et « Melon » à ce stade suscite des spéculations infinies.

Hypothèse 1 : La contre-attaque ultime d'Opus 5.1.

Beaucoup pensent que ces deux modèles, étroitement liés à Opus 5.1, sont précisément les « versions surpuissantes » retravaillées en urgence par Anthropic pour corriger les défauts d'Opus 5.

En introduisant un puissant mécanisme de « tokens de réflexion », ils forcent l'élévation du plafond logique du modèle.

Hypothèse 2 : L'assaut de la nouvelle génération Sonnet / Haiku.

Certains testeurs estiment, compte tenu de leur vitesse et de leur rapport qualité-prix impressionnants, qu'il pourrait s'agir de versions mises à jour de Sonnet ou de Haiku, d'autant qu'ils ne portent pas le titre suprême « Fable ».

Mais quelle que soit la situation, une chose est claire : Anthropic ne tient plus en place.

Ils accélèrent frénétiquement le rythme d'itération, n'hésitant pas à mettre en test direct des modèles de pointe extrêmement gourmands en calcul.

Les développeurs n'en peuvent plus d'impatience : « Les prochaines semaines et les prochains mois vont être extrêmement intéressants ! »

Marshmallow et Melon parviendront-ils à laver l'affront subi par Opus 5 et à faire remporter une nouvelle manche à Anthropic ?

Références :

https://x.com/Lentils80/status/2091704307863142812?s=20

https://x.com/NFT_Chen/status/2091764673767198730?s=20

Cet article provient du compte WeChat officiel « New Zhiyuan » (新智元), auteur : ASI Apocalypse ; Éditeur : Aeneas

Questions liées

QQuels sont les deux nouveaux modèles Claude mentionnés dans l'article et quelles sont leurs principales caractéristiques ?

ALes deux nouveaux modèles sont Claude Marshmallow-EAP (Guimauve) et Claude Melon-EAP (Melon). Leurs principales caractéristiques sont des capacités exceptionnelles en raisonnement spatial 3D (apprentissage par renforcement 3D et agencement de bâtiments en one-shot) et une consommation massive de 'tokens de pensée' (Thinking Tokens) pour un raisonnement logique profond avant de fournir une réponse.

QQuel est le défi traditionnel des LLM que ces nouveaux modèles semblent avoir surmonté, et quelles en seraient les applications potentielles ?

ALe défi traditionnel est l'imagination spatiale et la compréhension des relations physiques 3D (comme les coordonnées, la gravité, les structures porteuses). Les applications potentielles incluent la génération de modèles 3D pour les jeux vidéo, la conception architecturale, les jumeaux numériques industriels et les environnements de simulation pour la conduite autonome.

QQu'est-ce que les 'tokens de pensée' (Thinking Tokens) et pourquoi leur utilisation massive est-elle significative ?

ALes 'tokens de pensée' sont des tokens générés de manière invisible en arrière-plan par le modèle pour effectuer une auto-déduction profonde, construire des chaînes de raisonnement et tester des logiques avant de produire la réponse finale. Leur utilisation massive signale qu'Anthropic se concentre sur le dépassement des limites du raisonnement profond des IA, déplaçant la compétition vers la consommation de puissance de calcul lors de l'inférence.

QQuelle est la spéculation avancée dans l'article concernant le timing de la fuite de ces modèles, en lien avec le récent lancement d'Opus 5 ?

AL'article suggère que la fuite de ces modèles pourrait être une réaction d'Anthropic aux critiques négatives importantes reçues par Opus 5, lancé fin juillet 2026. Ils pourraient être des versions améliorées d'urgence (comme un Opus 5.1) ou de nouvelles itérations de Sonnet/Haiku, destinées à combler les déficiences perçues d'Opus 5 et à regagner la confiance des utilisateurs.

QQuel indice mentionné dans l'article suggère que ces modèles sont encore dans une phase de test limitée ?

AL'article indique que les modèles n'ont pas encore de point de terminaison API officiel (premier parti) et semblent être réservés aux testeurs 'red team' ou au personnel interne principal, comme en témoigne leur apparition en tant que 'Custom model' dans Claude Code avec un accès très limité détecté via des traces de flux API.

Lectures associées

Test de la demande : les baleines Bitcoin ont réalisé un bénéfice record de 1,2 milliard de dollars, et les détenteurs d'Ethereum sont revenus à la rentabilité

Test de la demande : les baleines du Bitcoin ont réalisé un bénéfice record de 1,2 milliard de dollars en trois jours après la reprise du prix de la première cryptomonnaie, rapporte CryptoQuant. Le pic a été atteint le 20 août avec environ 614 millions de dollars, un record quotidien absolu. Les analystes notent que ces prises de bénéfices ont commencé après que le Bitcoin soit repassé au-dessus du prix moyen d'acquisition des baleines à court terme (environ 68 900 $), le 23 août le prix étant d'environ 77 700 $, soit 12,8% plus élevé. Cette situation est considérée comme un test crucial pour la demande de Bitcoin. Si le prix se maintient au-dessus de ce niveau et que les prises de bénéfices se normalisent, cela pourrait indiquer une demande nouvelle suffisante pour absorber les ventes. Dans le cas contraire, la hausse pourrait se transformer en simple sortie à l'équilibre pour les investisseurs précédemment en perte. Parallèlement, les grands détenteurs d'Ethereum sont également retournés en zone de bénéfices non réalisés. Cependant, les ratios de bénéfices non réalisés restent relativement bas (entre 0,075 et 0,38 selon les groupes de détenteurs), ce qui, selon l'analyste Darkfost, ne devrait pas créer une pression de vente significative. Cette amélioration de la rentabilité est perçue comme un signal positif pour le sentiment du marché, Ethereum ayant augmenté de plus de 65% depuis juin, période où les baleines étaient en perte importante.

cryptonews.ruIl y a 2 mins

Test de la demande : les baleines Bitcoin ont réalisé un bénéfice record de 1,2 milliard de dollars, et les détenteurs d'Ethereum sont revenus à la rentabilité

cryptonews.ruIl y a 2 mins

Kinetiq annonce le réseau L2 Elysium pour Hyperliquid

Le 24 août, le protocole de liquid staking Kinetiq a annoncé Elysium, un nouveau réseau L2 pour l'écosystème Hyperliquid. Cette couche 2 vise à augmenter le débit d'HyperEVM et à simplifier le lancement de marchés au comptant, de tokens et d'applications DeFi. Le jeton $HYPE sera utilisé pour payer les frais de gaz (gas) sur Elysium. Le réseau sera directement lié au moteur de trading HyperCore, permettant aux applications d'accéder à sa liquidité et à ses données de carnet d'ordres. Les spécifications techniques et la liste des partenaires seront dévoilées ultérieurement, et la date de lancement précisée comme "prochainement". Une motivation clé derrière Elysium est de pallier les limitations d'HyperEVM, notamment son faible débit, la hausse des frais en période de congestion et son architecture à deux blocs. Elysium promet dès le départ une vitesse de traitement des transactions bien supérieure, destinée notamment au trading spot haute fréquence, aux AMM et aux services DeFi nécessitant des mises à jour fréquentes. L'accès aux données de HyperCore sera également élargi. Elysium vise aussi à simplifier le processus de lancement d'un nouvel actif dans l'écosystème Hyperliquid, en combinant en un flux unique la fourniture de liquidité initiale via un AMM, le listing sur le marché spot de HyperCore et le lancement éventuel de contrats perpétuels via le mécanisme HIP-3. Le modèle de revenus d'Elysium prévoit que 50% des frais du séquenceur seront utilisés pour racheter et brûler le token $KNTQ. 25% iront aux développeurs d'applications utilisant l'espace bloc, et les 25% restants seront versés au trésor de Kinetiq. Cette expansion marque un développement des activités de Kinetiq au-delà du simple liquid staking de $HYPE, dont le produit principal reste le kHYPE. Rappelons qu'en juin, Hyperliquid a atteint 10 milliards de dollars d'intérêt ouvert (open interest), se classant comme la troisième plus grande plateforme de trading de contrats perpétuels.

cryptonews.ruIl y a 3 mins

Kinetiq annonce le réseau L2 Elysium pour Hyperliquid

cryptonews.ruIl y a 3 mins

Hyperliquid Policy Center a exhorté les régulateurs américains à créer un cadre pour les contrats à terme perpétuels

Le Hyperliquid Policy Center, une organisation à but non lucratif créée en février 2026 pour promouvoir la finance décentralisée (DeFi), a appelé la SEC et la CFTC américaines à créer un cadre réglementaire pour les contrats à terme perpétuels. L'organisation demande une harmonisation des règles et une clarification de leur classification, en particulier pour les produits dérivés sur titres. L'argument central est que la juridiction d'un contrat devrait être déterminée par l'actif sous-jacent, sans changer sa nature économique. Le Hyperliquid Policy Center estime que les contrats perpétuels sur actions devraient être classés comme des contrats à terme standard, relevant de la surveillance conjointe de la CFTC et de la SEC, et non comme des swaps sur titres (SBS). Cette classification est justifiée par la standardisation, la négociation publique, la possibilité de clôture par compensation et le fait que la possession du contrat n'implique pas la possession de l'actif sous-jacent. L'organisation demande aux régulateurs de publier des orientations communes, d'éviter un test de classification trop rigide, d'appliquer une approche uniforme à tous les contrats à terme (bitcoin, matières premières, actions) et de moderniser le cadre réglementaire. Cette initiative s'inscrit dans un contexte de débat réglementaire, la CFTC et la SEC ayant sollicité des commentaires publics sur les règles SBS en juin 2026. Elle rencontre également une opposition des bourses traditionnelles comme le CME Group et l'ICE, qui réclament une régulation plus stricte pour les plateformes comme Hyperliquid. Le CME Group a même intenté un procès à la CFTC concernant la classification des contrats perpétuels, plaidant pour qu'ils soient considérés comme des swaps, soumis à des exigences plus sévères.

cryptonews.ruIl y a 5 mins

Hyperliquid Policy Center a exhorté les régulateurs américains à créer un cadre pour les contrats à terme perpétuels

cryptonews.ruIl y a 5 mins

Trading

Spot
活动图片