Les deux nouveaux modèles de Claude — Marshmallow et Melon — révélés hier font déjà l'objet de tests concrets aujourd'hui !
Des tests préliminaires montrent que les performances des deux modèles en apprentissage par renforcement 3D et en agencement spatial architectural sont tout simplement terrifiantes.

De plus, leur consommation en ressources de calcul est elle aussi démente.
Avant de fournir une réponse, ils consomment des quantités astronomiques de « tokens de réflexion » (Thinking Tokens) pour effectuer un raisonnement logique en profondeur, frôlant à plusieurs reprises la limite maximale autorisée par le système !
À travers ces modèles, Claude est en train d'évoluer vers une nouvelle génération de colosse de l'IA, capable d'une « réflexion lente » et d'un raisonnement spatial et physique profond.

Apprentissage par renforcement 3D et agencement architectural maîtrisés en un seul essai (One-Shot)
Un testeur a donné son avis : Anthropic avance à toute vitesse dans l'apprentissage par renforcement 3D.
Les agencements spatiaux de bâtiments sont incroyablement bons, et tout cela est généré en une seule fois (One-Shot) !


Il faut savoir que pour les LLM, l'imagination spatiale a toujours été un point faible mortel.
Faire comprendre à une IA les relations de coordonnées physiques entre une table et une chaise dans une pièce 3D, les lois de la gravité, ou planifier l'agencement d'un complexe architectural avec des circulations complexes et des structures porteuses, était jusqu'ici une tâche quasi impossible.
Mais cette fois, les modèles « Marshmallow » et « Melon » de Claude semblent avoir franchi ce fossé.
Ils peuvent directement comprendre et générer des coordonnées 3D et des relations spatiales complexes.
De plus, les tests montrent que leurs agencements architecturaux sont exceptionnels, ce qui indique que les nouveaux modèles sont également très performants pour traiter les contraintes topologiques, géométriques et physiques.
Et ils produisent cela en One-Shot, sans nécessiter de multiples ajustements des prompts par un humain pour corriger les erreurs. Après une réflexion interne approfondie, le modèle peut sortir des données de scène 3D parfaites en une seule fois.
Cette capacité cache une valeur commerciale et industrielle énorme.
Imaginez : à l'avenir, un développeur de jeux pourrait simplement décrire en langage naturel : « Génére-moi une forteresse de style médiéval avec trois tours de défense et un passage secret souterrain », et Claude pourrait directement produire le code du modèle 3D ou les paramètres d'agencement parfaits.
Un architecte pourrait demander à l'IA de générer des dizaines de propositions préliminaires d'agencements conformes à la mécanique des structures, en fonction du terrain et des conditions d'éclairage. La construction des métavers, des jumeaux numériques industriels, des environnements de simulation pour la conduite autonome...
Tout cela serait radicalement transformé par cette puissante capacité de génération 3D !
Le double coup de force de Marshmallow et Melon
Hier, tout Internet était inondé de posts sur Marshmallow et Melon.
Les deux modèles révélés portent les noms de code internes claude-marshmallow-eap (Marshmallow) et claude-melon-eap (Melon).

Cette convention de nommage « nourriture + EAP » poursuit la tradition établie en juillet dernier avec le modèle claude-horchata-eap (Horchata, une boisson mexicaine) brièvement testé.
D'où viennent donc ces deux modèles ?
D'après les données interceptées par un développeur dans les logs de trafic API, l'ID claude-marshmallow-ht-eap a été appelé à haute fréquence 57 fois entre 00:45 et 00:57Z le 21 août !
Peu après, il est apparu dans la liste des modèles de Claude Code sous l'intitulé « Custom model », avec une fenêtre de contexte ultra-longue atteignant 1 million de tokens.
Bien que ces deux modèles ne disposent pas encore de point d'accès API officiel et semblent réservés aux testeurs de l'équipe rouge (red team) ou au personnel interne clé, les retours des premiers tests sporadiques sont déjà explosifs.



Les capacités globales de « Marshmallow » sont considérées comme légèrement supérieures à celles de « Melon ».
Dans les conversations quotidiennes et les interactions logiques, l'expérience avec « Marshmallow » est même jugée meilleure que celle avec l'actuel Opus 5, la conversation paraissant plus naturelle et agréable.
Bien que leurs performances actuelles semblent encore inférieures au niveau suprême « Fable » d'Anthropic, sont-ils la fameuse version Opus 5.1 ? Sonnet 5.1 ? Ou une toute nouvelle itération de Haiku ?
Rien n'est encore certain.

Dévoreurs de puissance de calcul : les « tokens de réflexion » fous
Qui plus est, plusieurs testeurs ont découvert un phénomène extrêmement inhabituel : lors de leur utilisation, ces deux nouveaux modèles atteignent un niveau de consommation de ressources de calcul complètement dément !
Un testeur s'est exclamé sur X : « J'ai remarqué un point commun entre ces deux modèles : ils utilisent une quantité astronomique de tokens de réflexion, au point que pendant mes tests, j'ai plusieurs fois directement atteint la limite ! »
Qu'est-ce qu'un « token de réflexion » ? Pourquoi est-il si important ?
Dans les interactions passées avec les grands modèles, l'IA ressemblait souvent à un répondant « vif et prompt », générant instantanément une réponse mot à mot selon une distribution de probabilités.
La nouvelle génération de modèles de Claude change radicalement cette logique. Avant de fournir la réponse finale, le modèle génère en arrière-plan une grande quantité de tokens « invisibles », utilisés pour effectuer une auto-déduction extrêmement profonde, construire des chaînes de raisonnement et tester des logiques.

Cet investissement « sans compter » en puissance de calcul envoie un signal extrêmement fort : Anthropic est en train de s'attaquer en secret au goulet d'étranglement du raisonnement profond de l'IA !
Cela confirme également les suppositions antérieures dans le secteur — la compétition entre grands modèles se déplace de « l'empilement de puissance de calcul en phase d'entraînement » vers « la consommation de puissance de calcul en phase d'inférence ».
Lorsque Claude commence à « réfléchir » frénétiquement jusqu'à frôler les limites, la qualité des réponses qu'il produit constituera un avantage écrasant sur les modèles traditionnels.
Une intervention d'urgence ? La « bataille de la revanche » d'Opus 5
La fuite soudaine de ces deux modèles mystérieux intervient également à un moment crucial.
Il y a à peine un mois, le 24 juillet 2026, Anthropic a dévoilé son modèle phare très attendu, Opus 5.
Auparavant, Sonnet 5, sorti le 30 juin, avait été très bien accueilli.
Cependant, Opus 5 a essuyé un échec cuisant.
Un développeur s'est moqué sans pitié sur X : « Les critiques négatives sur Opus 5 sont si graves qu'Anthropic a dû sortir immédiatement deux nouveaux modèles pour essayer de le remplacer... Mort de rire. »
En effet, Opus 5 ne semble pas avoir répondu aux attentes d'une « amélioration intergénérationnelle ». Pour Anthropic, pressé d'aller vers une introduction en bourse, c'est sans aucun doute un revers majeur.
C'est pourquoi la révélation de « Marshmallow » et « Melon » à ce stade suscite des spéculations infinies.
Hypothèse 1 : La contre-attaque ultime d'Opus 5.1.
Beaucoup pensent que ces deux modèles, étroitement liés à Opus 5.1, sont précisément les « versions surpuissantes » retravaillées en urgence par Anthropic pour corriger les défauts d'Opus 5.
En introduisant un puissant mécanisme de « tokens de réflexion », ils forcent l'élévation du plafond logique du modèle.
Hypothèse 2 : L'assaut de la nouvelle génération Sonnet / Haiku.
Certains testeurs estiment, compte tenu de leur vitesse et de leur rapport qualité-prix impressionnants, qu'il pourrait s'agir de versions mises à jour de Sonnet ou de Haiku, d'autant qu'ils ne portent pas le titre suprême « Fable ».

Mais quelle que soit la situation, une chose est claire : Anthropic ne tient plus en place.
Ils accélèrent frénétiquement le rythme d'itération, n'hésitant pas à mettre en test direct des modèles de pointe extrêmement gourmands en calcul.
Les développeurs n'en peuvent plus d'impatience : « Les prochaines semaines et les prochains mois vont être extrêmement intéressants ! »
Marshmallow et Melon parviendront-ils à laver l'affront subi par Opus 5 et à faire remporter une nouvelle manche à Anthropic ?
Références :
https://x.com/Lentils80/status/2091704307863142812?s=20
https://x.com/NFT_Chen/status/2091764673767198730?s=20
Cet article provient du compte WeChat officiel « New Zhiyuan » (新智元), auteur : ASI Apocalypse ; Éditeur : Aeneas





