Claude Code est-il vraiment si gourmand en tokens ? Une expérience comparative le révèle : jusqu'à 30 fois d'écart entre les trois frameworks

marsbitPublié le 2026-07-31Dernière mise à jour le 2026-07-31

Résumé

L'expérience menée par Composio compare trois cadres d'agent (harness) — Claude Code, Hermes et Kimi Code — exécutant 28 tâches identiques avec le même modèle Kimi K3. Si les taux de réussite sont similaires (22, 21 et 20 tâches respectivement), la consommation de tokens diffère énormément : Claude Code utilise en médiane 6 fois plus de tokens que Kimi Code (340k vs 61k), avec un écart pouvant atteindre 30 fois. En coût, cela se traduit par environ 2 $ par tâche pour Claude Code contre 0,22 $ pour Kimi Code. Hermes est le plus rapide (179 secondes), Kimi Code le plus économe en tokens. L'analyse révèle que la surconsommation de Claude Code provient principalement des tokens d'entrée, son harness réinjectant massivement l'historique des contextes à chaque tour. Une étude de Writer confirme cette tendance : optimiser le harness réduit les coûts de 41% et la latence de 44%, sans perte de qualité. Ainsi, le choix du harness devient aussi crucial que celui du modèle pour la rentabilité des agents, marquant un tournant vers « l'harness comme produit ».

Tout le monde dit que Claude Code gaspille des tokens, mais à quel point ? Quelqu'un a enfin fait le calcul.

Une expérience comparative très intéressante a récemment été menée par l'équipe de Composio. Ils ont utilisé le même modèle, Kimi K3, et l'ont exécuté dans trois frameworks d'agent (harness) différents – Claude Code, Hermes et Kimi Code – pour tester 28 tâches identiques.

Les résultats montrent que les taux de réussite des trois harness sont similaires : Kimi Code a réussi 22 tâches sur 28, Hermes 21, et Claude Code 20. L'écart n'est pas énorme.

Ce qui fait vraiment la différence, c'est la consommation de tokens. Pour une même tâche, selon le harness utilisé, la quantité de tokens consommée peut varier jusqu'à 30 fois !

En valeur médiane, Kimi Code utilise environ 61 000 tokens, Hermes environ 67 000, tandis que Claude Code atteint les 340 000, soit environ 6 fois plus que Kimi Code.

En prenant le prix de Kimi K3 de 3 dollars par million de tokens d'entrée (les tokens d'entrée représentant généralement environ 95 % des flux de travail d'agent), le coût moyen par tâche est d'environ : Kimi Code 0,22 dollar, Hermes 0,28 dollar, et Claude Code atteint 2 dollars. L'écart est évident.

La vitesse diffère également. En temps médian, Hermes est le plus rapide avec 179 secondes ; Kimi Code prend 297 secondes ; Claude Code 348 secondes.

Ainsi, le plus rapide est Hermes, le plus économe en tokens est Kimi Code, les deux ne coïncidant pas.

L'équipe de Composio en tire une conclusion directe : si vous voulez réduire le coût de vos agents, vérifiez d'abord quel harness vous utilisez, plutôt que de changer de modèle en urgence. Selon leurs données, le harness à lui seul peut faire varier le coût par un facteur de 9, alors que les performances des modèles sont en réalité similaires.

Sebastian Raschka a commenté ces résultats, disant qu'ils correspondaient à ses observations précédentes avec Qwen3.6 : avec un taux de réussite similaire, Claude Code consomme souvent 2 à 3 fois plus de tokens que de nombreux autres harness.

Il a avancé plusieurs raisons possibles : un manque d'optimisation ? Un bug ? Ou une conception intentionnelle (car cela pourrait aider sur des tâches plus difficiles) ? Il a déclaré avoir besoin de plus de temps pour vérifier en détail.

Il a ensuite ajouté des observations faites le mois dernier lorsqu'il écrivait un article sur un agent de codage local. En analysant pourquoi Claude Code utilise plus de tokens, il a constaté que la différence provenait principalement des tokens d'entrée, et non de sortie. En d'autres termes, Claude n'écrit pas deux fois plus de contenu. Les journaux montrent que le harness de Claude réinjecte de manière répétée plus de contexte au modèle lors des interactions multi-tours, y compris les messages précédents, les appels d'outils, les sorties de commandes et le contenu des fichiers. Par exemple, lors d'une exécution, Claude a utilisé environ 578 000 tokens d'entrée, mais seulement environ 4 500 tokens de sortie, sur 25 tours. L'explication la plus probable est donc que le harness de Claude accumule ou compte un historique de prompt plus important lors des exécutions d'agent à plusieurs étapes.

Ces résultats semblent révéler une tendance inévitable : l'importance du harness n'est plus inférieure à celle du modèle lui-même.

Un article récent (de Writer, une entreprise qui développe une plateforme d'IA Agent pour les entreprises) le démontre systématiquement : grâce à une expérience à variables contrôlées, il prouve que changer la couche de harness réduit davantage les coûts que de changer de modèle, et cela profite à tous les modèles.

Plus précisément, ils ont mené une expérience stricte en « variables contrôlées » : en fixant 22 tâches d'entreprise et 6 modèles de base (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), ils ont uniquement remplacé la couche d'orchestration – en substituant la boucle d'agent de production traditionnelle par le Harness propriétaire de Writer.

Les résultats montrent : une réduction moyenne de 41 % du coût par tâche (0,21 $ → 0,12 $), une réduction médiane de la latence de 44 % (48 s → 27 s), une consommation de tokens réduite de 38 % (14,2k → 8,8k), tandis que la qualité d'exécution des tâches reste globalement stable (0,78 → 0,81, considéré comme non significatif en raison de la petite taille de l'échantillon). En termes de rapport qualité-prix, l'amélioration de la qualité obtenue par dollar a augmenté de 82 %, et le nombre de tâches pouvant être accomplies par million de tokens est passé de 54,9 à 92,0.

Alors, maintenant que les modèles sont devenus des « commodités », le harness serait-il le climatiseur qui détermine votre facture d'électricité ? Autrement dit : alors qu'on disait autrefois « le modèle est le produit », est-ce que maintenant c'est « le harness est le produit » ?

Étant donné l'importance du harness, ne faudrait-il pas aussi faire des calculs plus précis à l'avenir ?

Certains soulignent qu'il est nécessaire d'ajouter un élément « taxe harness » aux benchmarks existants. Surtout lorsque les appels d'outils et les nouvelles tentatives entrent en boucle, cette « taxe » n'augmente pas de manière linéaire.

En d'autres termes, la compétition des agents de demain se jouera en deux temps : la première partie sera « qui peut le faire », la seconde partie sera « qui peut faire la même chose en consommant moins » – et le secret des économies ne réside pas dans le modèle, mais dans le harness.

Avez-vous eu des expériences similaires lors de l'exécution d'Agents ? Partagez-les dans les commentaires.

Cet article provient du compte WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart

Questions liées

QSelon l'article, quel cadre (harness) consomme le plus de tokens en médiane pour accomplir une tâche ?

AEn médiane, Claude Code consomme environ 340 000 tokens, ce qui est nettement supérieur aux 61 000 tokens de Kimi Code et aux 67 000 tokens de Hermes.

QQuel est le coût moyen approximatif d'une tâche utilisant Claude Code avec le modèle Kimi K3, selon l'expérience ?

ALe coût moyen d'une tâche avec Claude Code est d'environ 2 dollars, basé sur le prix de 3 dollars par million de tokens d'entrée pour Kimi K3.

QQuelle raison principale Sebastian Raschka suggère-t-il pour expliquer la consommation élevée de tokens de Claude Code ?

AIl suggère que la différence provient principalement des tokens d'entrée. Le harness de Claude a tendance à réinjecter beaucoup de contexte (messages précédents, appels d'outils, sorties de commandes, contenu de fichiers) dans le modèle à chaque tour d'interaction de l'agent, ce qui accumule un historique de prompt très volumineux.

QQuel est le principal point soulevé par l'article concernant l'importance relative du harness et du modèle dans le développement d'agents ?

AL'article souligne que l'importance du harness (cadre d'exécution) est désormais comparable, voire supérieure, à celle du modèle lui-même. Changer de harness peut réduire les coûts et améliorer l'efficacité de manière plus significative que de changer de modèle, pour une qualité de résultat similaire.

QQuel terme l'article propose-t-il d'ajouter aux benchmarks pour mieux refléter l'impact des harness sur les coûts ?

AL'article propose d'ajouter une « taxe harness » (harness tax) aux benchmarks existants, car les coûts associés aux appels d'outils et aux tentatives de réessai dans une boucle ne sont pas linéaires et peuvent considérablement alourdir la facture.

Lectures associées

Ne pas investir n'est pas un laissez-passer pour Apple

Face aux géants technologiques comme Meta et Google qui font face à des critiques pour leurs dépenses d'investissement massives dans l'IA, Apple, bien qu'en retard dans ce domaine, se distingue par sa retenue budgétaire. Cette approche lui a même permis de retrouver brièvement la première place mondiale en termes de valorisation boursière. Le rapport trimestriel (T3 2026) d'Apple affiche des performances solides, avec un chiffre d'affaires en hausse de 16,4% et un bénéfice net en progression de 27,1%. L'iPhone et le Mac sont les principaux moteurs de cette croissance, compensant les résultats plus modestes de l'iPad (en baisse) et des services (ralentissement de la croissance). Cependant, le marché réagit négativement après la publication des résultats, en raison des perspectives prudentes pour le trimestre suivant. Apple anticipe des contraintes d'approvisionnement majeures, notamment pour les puces et la mémoire, entraînant des hausses de prix sur ses produits. Contrairement à ses concurrents qui investissent des milliards dans l'infrastructure IA, Apple maintient des dépenses d'investissement (capex) faibles, privilégiant les dépenses de R&D. Malgré cela, l'entreprise n'échappe pas aux répercussions de la frénésie de l'IA, qui exacerbe les tensions sur sa chaîne d'approvisionnement. Ce rapport marque la dernière conférence téléphonique de Tim Cook en tant que PDG, avant son départ prévu en septembre. Il exprime sa confiance dans l'avenir de l'entreprise.

marsbitIl y a 1 mins

Ne pas investir n'est pas un laissez-passer pour Apple

marsbitIl y a 1 mins

PA Figure | Une infographie pour comprendre les grands événements de l'écosystème Web3 en août 2026

Août 2026 s'annonce chargé pour l'écosystème Web3, marqué par plusieurs événements clés susceptibles d'influencer les marchés. L'agenda macroéconomique sera déterminant, avec la publication des données américaines sur l'emploi (non-farm payrolls) et l'inflation (CPI) de juillet, ainsi que les comptes-rendus de la Réserve Fédérale et le symposium annuel de Jackson Hole. Sur le front réglementaire, des développements majeurs sont attendus : le Sénat américain doit dévoiler un nouveau projet de loi (*CLARITY Act*), tandis que l'interdiction des transactions cryptos de l'UE envers la Biélorussie entre en vigueur. Les marchés devront également absorber des déblocages massifs de jetons (**ENA, AVAX, CONX, ZRO, KAITO**, etc.), susceptibles de créer de la volatilité. Par ailleurs, l'industrie continuera son consolidation, avec l'arrêt ou la refonte prévus de plusieurs services comme Exchange Art, Ctrl Wallet, Zapper, NFTfi et Summer.fi, incitant les utilisateurs à gérer leurs actifs en conséquence. Du côté des entreprises, les résultats du Q2 de **SpaceX, Circle et Nvidia** seront publiés, et des levées de fonds importantes sont au programme, notamment pour la société chinoise Moonshot AI (pré-IPO). Enfin, des événements sectoriels majeurs comme **Bitcoin Asia 2026** et le **China Digital Expo 2026** se tiendront. En résumé, le mois d'août sera structuré autour des anticipations macroéconomiques, de l'évolution réglementaire, des déblocages de tokens et de la consolidation continue du secteur.

marsbitIl y a 14 mins

PA Figure | Une infographie pour comprendre les grands événements de l'écosystème Web3 en août 2026

marsbitIl y a 14 mins

La voix la plus célèbre de « Cassandre » de Wall Street s'attaque cette fois à NVIDIA

Une récente divulgation de l’investisseur Michael Burry, connu pour avoir prédit la crise des subprimes et immortalisé dans « The Big Short », a relancé les débats sur le marché. Fin juin, il a annoncé avoir pris des positions à découvert sur plusieurs valeurs technologiques, dont Nvidia (à un prix d’entrée de 198,09 $), Tesla, Applied Materials, Caterpillar et l’ETF SOXX (semiconducteurs). Le 1er juillet, il a ajouté Micron à sa liste, avant d’augmenter fin juillet ses positions sur Nvidia, Micron et SOXX. Ses arguments portent principalement sur les pratiques comptables dans le secteur de l’IA : selon lui, la durée d’amortissement des puces (étirée à 6 ans par les géants du cloud comme Microsoft ou Google) ne reflète pas leur obsolescence rapide (2-3 ans), ce qui gonflerait artificiellement les profits. Il évoque également des risques de « financement circulaire hors bilan », où Nvidia pourrait garantir des prêts à des clients pour qu’ils achètent ses propres puces, créant ainsi une demande artificielle. Enfin, il critique les rachats d’actions de Nvidia, accusés de doper artificiellement le bénéfice par action – une affirmation que la société a contestée en soulignant des erreurs de calcul. Les réactions sont partagées. D’un côté, des voix comme Steve Eisman (autre figure de « The Big Short ») restent prudentes mais ne suivent pas la position découverte, notant la croissance soutenue des revenus et des investissements en IA. De l’autre, Jim Chanos, célèbre vendeur à découvert, partage l’inquiétude sur les écarts comptables mais préfère cibler d’autres acteurs financiers plutôt que les fabricants de puces. Historiquement, les appels de Burry ont connu des succès mitigés : corrects sur des crises structurelles (subprimes, COVID), mais souvent prématurés ou erronés sur des arguments de valorisation (Tesla, Nvidia en 2023). Aujourd’hui, les positions à découvert sur Nvidia restent marginales (environ 1,4 % des actions en circulation), même si les pertes cumulées des vendeurs à découvert sur la valeur dépassent 5 milliards de dollars. Pour les investisseurs, l’intérêt réside moins dans le suivi des positions de Burry que dans la méthodologie sous-jacente : scruter les flux de trésorerie, questionner les traitements comptables agressifs et identifier les risques structurels, surtout quand le marché semble euphorique. La question centrale n’est pas de savoir si Burry a raison cette fois, mais plutôt quels enseignements tirer de son analyse pour évaluer la solidité réelle de la bulle présumée de l’IA.

marsbitIl y a 37 mins

La voix la plus célèbre de « Cassandre » de Wall Street s'attaque cette fois à NVIDIA

marsbitIl y a 37 mins

Sélection de la semaine丨Émotions épiques sur le marché boursier, l'entrée en bourse de Changxin Tech redéfinit le paysage du stockage, Saylor vise à rétablir l'ancrage du STRC vers le 8 septembre

PANews présente un résumé hebdomadaire de contenus clés. Les marchés ont connu une volatilité significative, avec des indices boursiers sud-coréens subissant plusieurs interruptions et une chute des actions technologiques liées à l'IA. Dans ce contexte, le bitcoin apparaît comme un actif relativement stable. Le paysage technologique évolue rapidement. Le géant de la mémoire Longxin Technology a fait ses débuts en bourse avec une capitalisation importante, symbolisant une percée pour la DRAM nationale. Parallèlement, la convergence de l'IA, des agents autonomes et des besoins en calcul redéfinit les secteurs, des GPU aux infrastructures énergétiques, les entreprises de minage de bitcoin se repositionnant autour de la gestion de l'électricité. Dans le domaine crypto, l'innovation se poursuit. Les portefeuilles intelligents pour agents IA et les mécanismes de paiement programmables gagnent en importance, attirant l'attention de grandes plateformes. De nouveaux modèles économiques, comme le protocole à jeton FWA qui combine NFT et système de tirage, génèrent un fort engagement. Cependant, un décalage est observé entre la croissance des revenus des principaux protocoles et la performance de leurs jetons. Le secteur des Real World Assets (RWA) voit son volume augmenter mais peine à mobiliser ses actifs. Les perspectives macroéconomiques restent mitigées. La Réserve Fédérale américaine maintient des taux directeurs élevés, signalant une orientation durablement restrictive malgré des divisions internes. Des analystes comme Tom Lee considèrent les récentes corrections comme un assainissement nécessaire, affirmant que la logique de long terme du secteur reste intacte. Des personnalités anticipent un rôle accru du bitcoin dans le futur système monétaire. Les informations marquantes incluent : des mouvements réglementaires affectant les courtiers pour investisseurs chinois, le plan de développement technique d'Ethereum à horizon 2030, une importante migration de staking par Lido, et des performances boursières variées pour les entreprises liées à la crypto et à l'IA. Michael Saylor a également annoncé un objectif de réalignement pour le STRC autour du 8 septembre.

marsbitIl y a 43 mins

Sélection de la semaine丨Émotions épiques sur le marché boursier, l'entrée en bourse de Changxin Tech redéfinit le paysage du stockage, Saylor vise à rétablir l'ancrage du STRC vers le 8 septembre

marsbitIl y a 43 mins

Lorsque le marché commence à s'interroger sur les dépenses en capital liées à l'IA : Analyse complète des résultats du Q2 des cinq géants technologiques

À la fin juillet 2026, les résultats trimestriels d'Alphabet, Intel, Microsoft, Meta et Apple ont tous mis en évidence une croissance robuste des revenus et des bénéfices, largement portée par les investissements et la demande en IA. Cependant, les réactions des investisseurs ont divergé, soulignant un changement d'attention : le marché s'interroge désormais sur le calendrier du retour sur investissement de ces dépenses massives en capital. Alphabet a affiché une croissance record de son chiffre d'affaires et une performance cloud exceptionnelle, mais son augmentation des dépenses d'investissement, entraînant un flux de trésorerie libre négatif pour la première fois, a provoqué une chute de son cours. Intel, malgré ses meilleures ventes depuis quinze ans, a vu son rebond boursier anéanti après l'annonce d'une hausse significative de son budget d'investissement. À l'inverse, Microsoft, en abaissant ses prévisions de dépenses en capital et en promettant des flux de trésorerie positifs, a connu une forte hausse de son action. Meta, dont les dépenses ont explosé et le flux de trésorerie libre s'est effondré, a subi la plus forte vente. Enfin, Apple, malgré des résultats records, a vu son action chuter en raison de prévisions inférieures aux attentes, pointant des contraintes d'approvisionnement. En résumé, la demande en IA reste solide, mais le marché sanctionne désormais les entreprises dont les investissements massifs menacent à court terme la rentabilité et les flux de trésorerie, récompensant celles qui maîtrisent leur trajectoire financière.

Odaily星球日报Il y a 50 mins

Lorsque le marché commence à s'interroger sur les dépenses en capital liées à l'IA : Analyse complète des résultats du Q2 des cinq géants technologiques

Odaily星球日报Il y a 50 mins

Trading

Spot
活动图片