Claude Code est-il vraiment si gourmand en tokens ? Une expérience comparative le révèle : jusqu'à 30 fois d'écart entre les trois frameworks

marsbitPublié le 2026-07-31Dernière mise à jour le 2026-07-31

Résumé

L'expérience menée par Composio compare trois cadres d'agent (harness) — Claude Code, Hermes et Kimi Code — exécutant 28 tâches identiques avec le même modèle Kimi K3. Si les taux de réussite sont similaires (22, 21 et 20 tâches respectivement), la consommation de tokens diffère énormément : Claude Code utilise en médiane 6 fois plus de tokens que Kimi Code (340k vs 61k), avec un écart pouvant atteindre 30 fois. En coût, cela se traduit par environ 2 $ par tâche pour Claude Code contre 0,22 $ pour Kimi Code. Hermes est le plus rapide (179 secondes), Kimi Code le plus économe en tokens. L'analyse révèle que la surconsommation de Claude Code provient principalement des tokens d'entrée, son harness réinjectant massivement l'historique des contextes à chaque tour. Une étude de Writer confirme cette tendance : optimiser le harness réduit les coûts de 41% et la latence de 44%, sans perte de qualité. Ainsi, le choix du harness devient aussi crucial que celui du modèle pour la rentabilité des agents, marquant un tournant vers « l'harness comme produit ».

Tout le monde dit que Claude Code gaspille des tokens, mais à quel point ? Quelqu'un a enfin fait le calcul.

Une expérience comparative très intéressante a récemment été menée par l'équipe de Composio. Ils ont utilisé le même modèle, Kimi K3, et l'ont exécuté dans trois frameworks d'agent (harness) différents – Claude Code, Hermes et Kimi Code – pour tester 28 tâches identiques.

Les résultats montrent que les taux de réussite des trois harness sont similaires : Kimi Code a réussi 22 tâches sur 28, Hermes 21, et Claude Code 20. L'écart n'est pas énorme.

Ce qui fait vraiment la différence, c'est la consommation de tokens. Pour une même tâche, selon le harness utilisé, la quantité de tokens consommée peut varier jusqu'à 30 fois !

En valeur médiane, Kimi Code utilise environ 61 000 tokens, Hermes environ 67 000, tandis que Claude Code atteint les 340 000, soit environ 6 fois plus que Kimi Code.

En prenant le prix de Kimi K3 de 3 dollars par million de tokens d'entrée (les tokens d'entrée représentant généralement environ 95 % des flux de travail d'agent), le coût moyen par tâche est d'environ : Kimi Code 0,22 dollar, Hermes 0,28 dollar, et Claude Code atteint 2 dollars. L'écart est évident.

La vitesse diffère également. En temps médian, Hermes est le plus rapide avec 179 secondes ; Kimi Code prend 297 secondes ; Claude Code 348 secondes.

Ainsi, le plus rapide est Hermes, le plus économe en tokens est Kimi Code, les deux ne coïncidant pas.

L'équipe de Composio en tire une conclusion directe : si vous voulez réduire le coût de vos agents, vérifiez d'abord quel harness vous utilisez, plutôt que de changer de modèle en urgence. Selon leurs données, le harness à lui seul peut faire varier le coût par un facteur de 9, alors que les performances des modèles sont en réalité similaires.

Sebastian Raschka a commenté ces résultats, disant qu'ils correspondaient à ses observations précédentes avec Qwen3.6 : avec un taux de réussite similaire, Claude Code consomme souvent 2 à 3 fois plus de tokens que de nombreux autres harness.

Il a avancé plusieurs raisons possibles : un manque d'optimisation ? Un bug ? Ou une conception intentionnelle (car cela pourrait aider sur des tâches plus difficiles) ? Il a déclaré avoir besoin de plus de temps pour vérifier en détail.

Il a ensuite ajouté des observations faites le mois dernier lorsqu'il écrivait un article sur un agent de codage local. En analysant pourquoi Claude Code utilise plus de tokens, il a constaté que la différence provenait principalement des tokens d'entrée, et non de sortie. En d'autres termes, Claude n'écrit pas deux fois plus de contenu. Les journaux montrent que le harness de Claude réinjecte de manière répétée plus de contexte au modèle lors des interactions multi-tours, y compris les messages précédents, les appels d'outils, les sorties de commandes et le contenu des fichiers. Par exemple, lors d'une exécution, Claude a utilisé environ 578 000 tokens d'entrée, mais seulement environ 4 500 tokens de sortie, sur 25 tours. L'explication la plus probable est donc que le harness de Claude accumule ou compte un historique de prompt plus important lors des exécutions d'agent à plusieurs étapes.

Ces résultats semblent révéler une tendance inévitable : l'importance du harness n'est plus inférieure à celle du modèle lui-même.

Un article récent (de Writer, une entreprise qui développe une plateforme d'IA Agent pour les entreprises) le démontre systématiquement : grâce à une expérience à variables contrôlées, il prouve que changer la couche de harness réduit davantage les coûts que de changer de modèle, et cela profite à tous les modèles.

Plus précisément, ils ont mené une expérience stricte en « variables contrôlées » : en fixant 22 tâches d'entreprise et 6 modèles de base (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), ils ont uniquement remplacé la couche d'orchestration – en substituant la boucle d'agent de production traditionnelle par le Harness propriétaire de Writer.

Les résultats montrent : une réduction moyenne de 41 % du coût par tâche (0,21 $ → 0,12 $), une réduction médiane de la latence de 44 % (48 s → 27 s), une consommation de tokens réduite de 38 % (14,2k → 8,8k), tandis que la qualité d'exécution des tâches reste globalement stable (0,78 → 0,81, considéré comme non significatif en raison de la petite taille de l'échantillon). En termes de rapport qualité-prix, l'amélioration de la qualité obtenue par dollar a augmenté de 82 %, et le nombre de tâches pouvant être accomplies par million de tokens est passé de 54,9 à 92,0.

Alors, maintenant que les modèles sont devenus des « commodités », le harness serait-il le climatiseur qui détermine votre facture d'électricité ? Autrement dit : alors qu'on disait autrefois « le modèle est le produit », est-ce que maintenant c'est « le harness est le produit » ?

Étant donné l'importance du harness, ne faudrait-il pas aussi faire des calculs plus précis à l'avenir ?

Certains soulignent qu'il est nécessaire d'ajouter un élément « taxe harness » aux benchmarks existants. Surtout lorsque les appels d'outils et les nouvelles tentatives entrent en boucle, cette « taxe » n'augmente pas de manière linéaire.

En d'autres termes, la compétition des agents de demain se jouera en deux temps : la première partie sera « qui peut le faire », la seconde partie sera « qui peut faire la même chose en consommant moins » – et le secret des économies ne réside pas dans le modèle, mais dans le harness.

Avez-vous eu des expériences similaires lors de l'exécution d'Agents ? Partagez-les dans les commentaires.

Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart

Questions liées

QSelon l'article, quel cadre (harness) consomme le plus de tokens en médiane pour accomplir une tâche ?

AEn médiane, Claude Code consomme environ 340 000 tokens, ce qui est nettement supérieur aux 61 000 tokens de Kimi Code et aux 67 000 tokens de Hermes.

QQuel est le coût moyen approximatif d'une tâche utilisant Claude Code avec le modèle Kimi K3, selon l'expérience ?

ALe coût moyen d'une tâche avec Claude Code est d'environ 2 dollars, basé sur le prix de 3 dollars par million de tokens d'entrée pour Kimi K3.

QQuelle raison principale Sebastian Raschka suggère-t-il pour expliquer la consommation élevée de tokens de Claude Code ?

AIl suggère que la différence provient principalement des tokens d'entrée. Le harness de Claude a tendance à réinjecter beaucoup de contexte (messages précédents, appels d'outils, sorties de commandes, contenu de fichiers) dans le modèle à chaque tour d'interaction de l'agent, ce qui accumule un historique de prompt très volumineux.

QQuel est le principal point soulevé par l'article concernant l'importance relative du harness et du modèle dans le développement d'agents ?

AL'article souligne que l'importance du harness (cadre d'exécution) est désormais comparable, voire supérieure, à celle du modèle lui-même. Changer de harness peut réduire les coûts et améliorer l'efficacité de manière plus significative que de changer de modèle, pour une qualité de résultat similaire.

QQuel terme l'article propose-t-il d'ajouter aux benchmarks pour mieux refléter l'impact des harness sur les coûts ?

AL'article propose d'ajouter une « taxe harness » (harness tax) aux benchmarks existants, car les coûts associés aux appels d'outils et aux tentatives de réessai dans une boucle ne sont pas linéaires et peuvent considérablement alourdir la facture.

Lectures associées

Le Bitcoin bondit de 10 000 dollars en une semaine, les vendeurs à découvert perdent 3 milliards de dollars

Le Bitcoin a connu une hausse de près de 10 000 dollars cette semaine, sortant d'une phase de six semaines de stagnation entre 60 000 et 65 000 dollars. Cette poussée a été déclenchée par l'annonce du Trésor américain de doubler le volume de ses rachats d'obligations à long terme pour soutenir la liquidité, faisant chuter les rendements des obligations d'État. Les marchés y ont vu un signal de liquidité, redirigeant les traders vers le Bitcoin comme couverture potentielle contre un éventuel assouplissement monétaire. Le mouvement s'est accéléré lorsque le prix a franchi la résistance clé de 70 000 dollars, provoquant un "short squeeze" record. Les vendeurs à découvert, pris au piège, ont subi des liquidations forcées massives, avec des pertes estimées à 3 milliards de dollars en 24 heures, le plus important épisode de ce type depuis 2021. Ces liquidations ont elles-mêmes alimenté la hausse. Ce rallye coïncide avec un regain d'attention politique, notamment l'appel public du président Trump à l'adoption de la loi CLARITY pour clarifier la régulation des actifs numériques, ainsi qu'une réunion à la Maison Blanche avec des leaders de l'industrie. Ces événements renforcent la perception d'un environnement réglementaire plus favorable à Washington. Alors que les marchés actions ont globalement réagi positivement à l'annonce du Trésor, le Bitcoin se rapproche désormais des 80 000 dollars, un niveau qu'il n'a plus atteint depuis mai.

cryptonews.ruIl y a 29 mins

Le Bitcoin bondit de 10 000 dollars en une semaine, les vendeurs à découvert perdent 3 milliards de dollars

cryptonews.ruIl y a 29 mins

Zcash, Bitcoin Cash et Cardano enregistrent une hausse, ZEC menant avec une progression de 47 %

Ces dernières 24 heures, le marché des altcoins a enregistré une hausse généralisée, avec Zcash (ZEC) en tête, progressant de 47,1% pour atteindre 836 dollars avant de se stabiliser autour de 810 dollars. Bitcoin Cash (BCH) a également augmenté de 31,4%, tandis que Cardano (ADA) a gagné 19%. La forte performance de Zcash est notamment attribuée à l'intérêt croissant pour les actifs axés sur la confidentialité et à l'initiative de Grayscale de transformer son fonds Zcash Trust en un ETF spot, qui serait le premier du genre aux États-Unis. D'autres cryptomonnaies comme Dogecoin (DOGE), Stellar (XLM) et Chainlink (LINK) ont également connu des hausses significatives, suggérant une injection de liquidités plus large plutôt qu'un catalyseur propre à un seul projet. L'élan haussier global est soutenu par l'optimisme entourant le projet de "Loi sur la transparence des marchés d'actifs numériques" aux États-Unis, ainsi que par l'annonce du Trésor américain d'étendre son programme de rachat d'obligations, libérant ainsi des liquidités pour les actifs risqués. Les analystes notent que ce rallye est accompagné d'une augmentation substantielle des volumes de négociation, indiquant un flux réel d'ordres. L'attention se porte désormais sur les progrès potentiels de la réglementation cryptographique au Congrès, qui pourraient prolonger la tendance haussière.

cryptonews.ruIl y a 29 mins

Zcash, Bitcoin Cash et Cardano enregistrent une hausse, ZEC menant avec une progression de 47 %

cryptonews.ruIl y a 29 mins

En raison des changements de stratégies, des modifications du système de récompenses et des commissions sont à prévoir sur les plateformes d'échange de cryptomonnaies

Au deuxième trimestre, les principales bourses de crypto-monnaies cotées en bourse (Coinbase, Bullish, Gemini) ont vu leurs revenus de trading diminuer dans un marché baissier persistant. Elles diversifient désormais leurs stratégies vers de nouveaux produits comme les stablecoins et les marchés de prédiction. Coinbase, tout en réduisant ses coûts, a augmenté les récompenses pour sa stablecoin USDC, captant environ la moitié du volume global de l'actif. Gemini a triplé ses market-makers sur ses marchés de prédiction et offre désormais des remises et récompenses, bien que la rentabilité de ce segment reste modeste. De son côté, Bullish a compensé une baisse trimestrielle de ses revenus de transaction par un nouveau programme de récompenses, étant la seule à afficher une croissance annuelle sur ce poste. Bien que les volumes et revenus de trading aient globalement chuté, l'« économie des commissions » s'est améliorée pour certaines plateformes, le déclin des revenus étant moins prononcé que celui des volumes. Si une reprise des marchés pourrait relancer les revenus de trading, la concurrence sur les commissions pourrait s'intensifier. La convergence croissante entre les plateformes de crypto-actifs et la finance traditionnelle devrait également accentuer cette rivalité, une dynamique potentiellement bénéfique pour les traders et investisseurs.

cryptonews.ruIl y a 31 mins

En raison des changements de stratégies, des modifications du système de récompenses et des commissions sont à prévoir sur les plateformes d'échange de cryptomonnaies

cryptonews.ruIl y a 31 mins

Trading

Spot
活动图片