Économisez 300 millions de Tokens par semaine : Le guide de mise en cache du code Claude par un ingénieur d'Anthropic

marsbitPublié le 2026-05-24Dernière mise à jour le 2026-05-24

Résumé

Claude Code utilise un mécanisme de cache pour réduire considérablement le coût des tokens. Les tokens mis en cache ne coûtent que 10% du prix des tokens d'entrée normaux. L'auteur a ainsi économisé 3 milliards de tokens en une semaine, dont 91 millions en un seul jour, grâce à la réutilisation du contexte. Le cache fonctionne par correspondance de préfixe et est organisé en trois couches : système (instructions globales), projet (CLAUDE.md, règles) et conversation (historique). Pour le forfait Claude Code, la durée de vie du cache (TTL) est d'une heure. Les actions qui réinitialisent le cache incluent le changement de modèle et l'activation du mode "Opus plan". Pour optimiser l'utilisation : - Ne laissez pas une session inactive plus d'une heure. - Lors d'un changement de tâche, effectuez une transition claire (session handoff) plutôt que de reprendre une ancienne conversation. - Évitez de basculer fréquemment entre les modèles. - Pour les grands documents, utilisez la fonctionnalité Projects plutôt que de les coller dans le chat. En surveillant le taux de réutilisation du cache (cache read), les utilisateurs peuvent prolonger efficacement leurs sessions et réduire leurs coûts, un objectif aligné avec les intérêts d'Anthropic en matière d'efficacité des services.

Note de la rédaction : Beaucoup de personnes utilisant Claude Code ont l'impression que les Tokens sont consommés trop vite et que les longues sessions épuisent facilement le quota. Mais du point de vue d'un ingénieur d'Anthropic, ce qui impacte réellement le coût, ce n'est pas tant la quantité de code écrite, mais plutôt la réutilisation continue du contexte déjà traité.

L'essentiel de cet article est d'expliquer comment économiser des Tokens via un mécanisme de cache. L'auteur a réutilisé plus de 300 millions de Tokens en une semaine grâce au cache, avec un pic quotidien de 91 millions. Le coût d'un Token en cache n'étant que de 10% de celui d'un Token d'entrée classique, 91 millions de Tokens en cache équivalent en facturation à environ 9 millions de Tokens normaux. Si les longues sessions de Claude Code semblent plus "économes", ce n'est pas parce que le modèle travaille gratuitement, mais parce qu'une grande partie du contexte répétitif est réutilisée avec succès.

La clé du "Prompt caching" est de "ne pas interrompre le cache". Claude Code met en cache de manière hiérarchique l'invite système, les définitions d'outils, CLAUDE.md, les règles du projet et l'historique de la conversation ; tant que le préfixe des requêtes suivantes reste cohérent, Claude peut lire directement depuis le cache au lieu de retraiter tout le contexte. Anthropic surveille également en interne le taux de réutilisation du cache de prompts, car cela affecte non seulement le quota utilisateur, mais aussi directement le coût du service de modèle et son efficacité opérationnelle.

Pour l'utilisateur lambda, il n'est pas nécessaire de comprendre tous les détails techniques, mais plutôt d'adopter quelques bonnes pratiques clés : ne pas laisser une session inactive plus d'une heure ; effectuer un transfert de session propre lors d'un changement de tâche ; éviter de changer fréquemment de modèle ; et privilégier l'ajout de grands documents dans les "Projects" plutôt que de les coller à plusieurs reprises dans la conversation.

Cet article ne se contente pas de donner une astuce pour économiser des Tokens, il propose plutôt une méthode d'utilisation de Claude Code plus proche de la pensée ingénieur : considérer le contexte comme un actif à gérer, permettant une réutilisation continue du cache et évitant aux longues sessions de refaire des calculs redondants.

Voici l'article original :

J'ai économisé 300 millions de Tokens cette semaine, dont 91 millions en une seule journée, soit plus de 300 millions sur la semaine.

Je n'ai modifié aucun paramètre. C'est simplement le "prompt caching" qui fonctionne normalement en arrière-plan.

Mais une fois que j'ai vraiment compris ce qu'est le cache et comment éviter de l'"interrompre", avec le même quota d'utilisation, mes sessions ont pu durer plus longtemps. Voici donc un guide d'introduction 80/20 sur le prompt caching de Claude Code, sans entrer dans les détails profonds de l'API.

TL;DR

Le coût d'un Token en cache est seulement 10% de celui d'un Token d'entrée normal. 91 millions de Tokens en cache équivalent en facturation à environ 9 millions de Tokens.

Le TTL (durée de vie) du cache pour l'abonnement Claude Code est de 1 heure ; par défaut 5 minutes pour l'API ; et toujours 5 minutes pour les Sub-agents.

Le cache est divisé en trois couches : système, projet, conversation.

Changer de modèle en cours de conversation détruit le cache, y compris l'activation du mode "opus plan".

Comment le cache est-il facturé exactement ?

Chaque Token mis en cache coûte 10% du prix d'un Token d'entrée normal.

Ainsi, lorsque mon tableau de bord montre qu'un jour donné, 91 millions de Tokens ont été servis depuis le cache, la facturation réelle équivaut environ au traitement de 9 millions de Tokens. C'est pourquoi, comparé à une utilisation sans cache, l'utilisation prolongée de Claude Code donne l'impression que les sessions s'allongent presque "gratuitement".

Deux chiffres dans le tableau de bord méritent une attention particulière :

Cache create (Création de cache) : Coût ponctuel généré lors de l'écriture du contenu dans le cache. Il commence à porter ses fruits lors du tour de conversation suivant.
Cache read (Lecture du cache) : Tokens que Claude réutilise depuis le cache, comme votre CLAUDE.md, les définitions d'outils, les messages précédents, etc. C'est 10 fois moins cher que de les retraiter comme nouvelle entrée.

Si votre chiffre "Cache read" est élevé, cela signifie que vous utilisez efficacement le cache ; s'il est bas, vous payez à plusieurs reprises pour le même contexte.

Thariq d'Anthropic a fait une remarque qui m'a marqué : "Nous surveillons en fait le taux d'utilisation du prompt cache. S'il devient trop bas, cela déclenche une alerte, voire un incident de niveau SEV."

Il a également écrit un excellent article sur X. Lorsque le taux d'utilisation du cache est élevé, quatre choses se produisent simultanément : Claude Code semble plus rapide, le coût du service d'Anthropic diminue, votre quota d'abonnement semble plus durable, et les longues sessions de codage deviennent plus réalistes.

Mais si le taux d'utilisation est faible, tout le monde y perd.

Ainsi, l'intérêt des deux parties est aligné : Anthropic souhaite que votre taux d'utilisation du cache soit élevé, et vous aussi. Ce qui vous freine réellement, ce sont quelques habitudes anodines en apparence, mais qui réinitialisent silencieusement le cache.

Comment le cache se développe-t-il à chaque tour de conversation ?

Le cache repose sur le "prefix matching" ou "correspondance de préfixe".

Sans entrer dans des détails techniques trop profonds, il suffit de comprendre ceci : tant que le contenu précédant une certaine position est exactement le même que celui déjà mis en cache, Claude peut réutiliser ces Tokens du cache.

Une session complètement nouvelle se déroule à peu près ainsi :

D'après la documentation de Claude Code, une session entièrement nouvelle s'exécute typiquement ainsi :

Premier tour de conversation : Pas encore de cache. L'invite système, le contexte de votre projet (comme CLAUDE.md, la mémoire, les règles), ainsi que votre premier message sont tous retraités et écrits dans le cache.

Deuxième tour de conversation : Tout le contenu du premier tour est maintenant en cache. Claude n'a qu'à traiter votre nouvelle réponse et le message suivant. Le coût de ce tour est bien plus bas.

Troisième tour de conversation : Même logique. Les tours de conversation précédents restent dans le cache, seul le dernier échange doit être retraité.

Le cache lui-même peut être divisé en trois couches :

D'après l'article de Thariq sur X :

Couche système (System layer) : Inclut les instructions de base, les définitions d'outils (read, write, bash, grep, glob) et le style de sortie. Cette couche est mise en cache globalement.

Couche projet (Project layer) : Inclut CLAUDE.md, la mémoire, les règles du projet. Cette couche est mise en cache par projet.

Couche conversation (Conversation) : Inclut les réponses et les messages, et s'étend à chaque tour de conversation.

Si, en cours de session, un élément de la couche système ou projet change, tout doit être remis en cache depuis le début. C'est l'opération la plus "coûteuse". Imaginez : vous en êtes au 16e message, vous modifiez soudain l'invite système, ou vous faites une pause d'une heure, alors tous les Tokens depuis le premier message devront être retraités.

La confusion entre 1 heure et 5 minutes

C'est le point le plus facilement mal compris.

Abonnement Claude Code : TTL par défaut de 1 heure.

API Claude : TTL par défaut de 5 minutes. Vous pouvez payer plus pour le porter à 1 heure.
Sub-agent (quel que soit le plan) : Toujours 5 minutes.

Chat web Claude.ai : Pas de documentation officielle claire. Probablement identique à l'abonnement, mais je n'ai pas pu le confirmer.

Il y a quelques mois, beaucoup se plaignaient que le quota Claude s'épuisait trop vite. Certains pensaient qu'Anthropic avait discrètement réduit le TTL de 1 heure à 5 minutes sans avertir les utilisateurs. Mais ce n'était pas le cas, le TTL de Claude Code reste de 1 heure.

Le problème vient du fait que la documentation de Claude Code et celle de l'API sont séparées, et qu'il s'agit de choses complètement différentes, ce qui a créé pas mal de confusion.

Si vous exécutez massivement des workflows de Sub-agents, ou utilisez directement l'API, le chiffre de 5 minutes est important. Mais pour 95% des utilisateurs de Claude Code, ce qu'il faut vraiment retenir, c'est cette fenêtre d'1 heure.

Trois habitudes pour couvrir 95% des utilisateurs

Voici ce que je trouve vraiment utile dans l'usage quotidien.

Ne pas faire de pause trop longue

Si vous êtes inactif depuis plus d'une heure, le contenu précédent a essentiellement expiré du cache. Votre prochain message reconstruira le cache. Dans ce cas, plutôt que de reprendre une ancienne session "refroidie", il est souvent plus économique de faire une transition claire, puis de démarrer une nouvelle session.

Lors d'un changement de tâche, recommencez directement

/compact ou /clear détruisent déjà le cache, donc autant profiter de ce moment pour vraiment réinitialiser.

J'ai créé une compétence "session handoff" (transfert de session) pour remplacer /compact. Elle résume ce que nous avons accompli, les décisions en suspens, les fichiers les plus importants, et par où reprendre. Ensuite, j'exécute /clear, je colle ce résumé, et je peux continuer comme si rien ne s'était interrompu.

La commande compact peut parfois être lente. Alors que cette compétence handoff se termine généralement en moins d'une minute.

Dans le chat Claude, placez les grands documents dans Projects

Le mécanisme de cache sur Claude.ai n'est pas officiellement très détaillé, mais il est évident que les Projects sont optimisés différemment des fils de conversation normaux. Donc, si vous devez coller de gros documents, mieux vaut les placer dans un Project plutôt que de les insérer directement dans la conversation.

Quelles actions détruisent silencieusement le cache ?

Certaines choses réinitialisent complètement le cache sans avertissement évident.

Changer de modèle : Parce que le cache dépend de la correspondance de préfixe, et chaque modèle a son propre cache. Dès que vous changez de modèle, la prochaine requête relira l'historique complet sans aucun accès au cache.

Mode "Opus plan" : Ce paramètre utilise Opus pour la phase de planification et Sonnet pour l'exécution. Je l'ai recommandé dans certaines vidéos d'optimisation de tokens, pour une bonne raison. Mais il faut comprendre que chaque activation de "plan" est essentiellement un changement de modèle, ce qui signifie reconstruire le cache. À long terme, cela aide toujours à prolonger le quota de session, mais vous devez savoir ce qui se passe en arrière-plan.

Modifier CLAUDE.md en cours de session est possible : Cette modification ne prend pas effet immédiatement, mais seulement au prochain redémarrage. Ainsi, le cache actuellement en cours n'est pas affecté.

Mon tableau de bord gratuit des Tokens

Les captures d'écran que j'ai montrées précédemment proviennent d'un tableau de bord de tokens.

C'est un dépôt GitHub très simple. Vous donnez le lien à Claude Code, vous lui demandez de le déployer en local sur localhost, et il lira l'historique de toutes vos sessions passées au lieu de démarrer les statistiques à zéro. Vous verrez immédiatement les données quotidiennes d'input, output, cache create et cache read.

Une mise en garde cependant : ce tableau de bord comptabilise les données de Token sur votre appareil local. Si vous passez d'un ordinateur de bureau à un ordinateur portable, les chiffres ne seront pas exactement les mêmes. Chaque appareil a sa propre vue statistique.

Conclusion

Le Prompt caching est un sujet qui peut être approfondi. L'article de Thariq est plus complet que celui-ci, si vous voulez une vue d'ensemble, cela vaut la peine de le lire.

Mais vous n'avez pas besoin de comprendre tous les détails pour en bénéficier. Il vous suffit de maîtriser l'essentiel 80/20 : un Token en cache coûte 10 fois moins cher qu'un Token normal ; le TTL de Claude Code est d'1 heure ; changer de modèle détruit le cache ; faire des transitions claires entre les tâches est souvent plus économique que de tenter de réutiliser une ancienne session devenue "obsolète".

Cryptos en tendance

Questions liées

QQu'est-ce que le prompt caching dans Claude Code et comment permet-il d'économiser des Tokens ?

ALe prompt caching est un mécanisme de mise en cache qui permet à Claude Code de réutiliser les contextes déjà traités, comme les instructions système, les définitions d'outils, le fichier CLAUDE.md et l'historique de conversation. En réutilisant ces éléments, le coût est réduit à 10 % de celui d'un Token d'entrée standard, ce qui permet d'économiser considérablement des Tokens sur les sessions longues.

QQuelles sont les trois couches de cache mentionnées dans l'article ?

ALes trois couches de cache sont : 1. La couche système (System layer) : comprend les instructions de base, les définitions d'outils et le style de sortie. 2. La couche projet (Project layer) : inclut CLAUDE.md, la mémoire et les règles du projet. 3. La couche conversation (Conversation layer) : contient les réponses et les messages, qui s'accumulent au fil des échanges.

QQuelle est la durée de vie (TTL) du cache pour Claude Code en version abonnement ?

APour la version abonnement de Claude Code, la durée de vie (TTL) du cache est de 1 heure. Cela signifie que le cache est conservé pendant une heure d'inactivité avant d'expirer.

QQuelles actions peuvent interrompre ou réinitialiser le cache ?

ALes actions suivantes peuvent interrompre ou réinitialiser le cache : - Changer de modèle (par exemple, passer de Sonnet à Opus). - Activer le mode "Opus plan", qui alterne entre les modèles. - Laisser une session inactive pendant plus d'une heure (pour Claude Code). - Utiliser des commandes comme /compact ou /clear.

QQuels conseils pratiques l'article donne-t-il pour optimiser l'utilisation du cache ?

ALes conseils pratiques incluent : 1. Ne pas laisser une session inactive pendant plus d'une heure. 2. Lors d'un changement de tâche, effectuer une transition claire (session handoff) plutôt que de reprendre une ancienne session. 3. Éviter de changer fréquemment de modèle. 4. Pour les documents volumineux, les placer dans un projet (Projects) plutôt que de les coller directement dans une conversation.

Lectures associées

L'affaire de divorce de Chey Tae-won finalisée : Révélations sur les lignes cachées de succession derrière le conglomérat de mille milliards de SK Hynix

L'affaire de divorce de Chey Tae-won, président du groupe SK, s'est conclue par un jugement historique, mettant en lumière les complexités successorales derrière le géant SK Hynix, dont la valorisation a dépassé 1 000 billions de wons. Contrairement aux scénarios traditionnels de succession des chaebols sud-coréens, qui privilégient l'aîné masculin, les trois enfants de Chey Tae-won suivent des trajectoires distinctes et modernes. L'aînée, Chey Yun-jeong, considérée comme la successeure la plus probable, occupe un poste de direction au sein de SK Inc. et dirige des projets stratégiques dans la biopharmacie, alliant formation scientifique et compétences en consulting. La seconde fille, Chey Min-jeong, ancienne officière de marine et ex-employée de SK Hynix aux États-Unis, a fondé une startup dans la santé numérique et épousé un ancien officier du Corps des Marines américain, incarnant les dimensions géopolitiques de l'industrie des semi-conducteurs. Le fils cadet, Chey In-geon, bien que suivant un parcours académique et professionnel classique (Brown University, McKinsey), reste discret et ne détient aucun rôle opérationnel visible au sein du groupe. Leur héritage est marqué par le divorce très médiatisé et coûteux de leurs parents, mais aussi par la transformation de SK Hynix en un acteur mondial de l'ère de l'IA. La succession ne se résume plus à une simple transmission d'actions ou de titre ; elle exige des héritiers qu'ils prouvent leurs compétences dans un paysage où la technologie, la politique internationale et l'innovation disruptive redéfinissent les règles du pouvoir.

marsbitHier 09:14

L'affaire de divorce de Chey Tae-won finalisée : Révélations sur les lignes cachées de succession derrière le conglomérat de mille milliards de SK Hynix

marsbitHier 09:14

2 mois pour passer de 8,8 à 68 milliards d'euros d'évaluation ! La plus grande plateforme de transit d'IA, OpenRouter, sur le point d'être rachetée

**Résumé en français :** Stripe, le géant du paiement en ligne, négocierait l'acquisition d'OpenRouter, une place de marché et couche d'IA de type "routeur" ou "agrégateur", pour près de 100 milliards de dollars. Cette valorisation représente une multiplication par près de sept par rapport à l'évaluation d'OpenRouter il y a deux mois (13 milliards de dollars). Fondée en 2023 par Alex Atallah (cofondateur d'OpenSea), OpenRouter agit comme un intermédiaire crucial pour les développeurs d'applications d'IA. Sa plateforme permet d'accéder via une seule API à plus de 400 grands modèles de langage (comme GPT, Claude, et de nombreux modèles open source) et choisit automatiquement le modèle le plus adapté à chaque tâche en fonction du coût, des performances et de la vitesse. Cela permet aux applications en aval de réduire leurs factures de "réflexion" (inference) sans que l'utilisateur final ne voie la différence. Pour Stripe, cette acquisition stratégique s'inscrit dans une volonté de devenir l'infrastructure de paiement et de gestion de la consommation pour l'économie de l'IA. Fin 2025, Stripe avait déjà acquis Metronome, une plateforme de facturation à l'usage pour l'IA. En combinant OpenRouter (choix du modèle) et Metronome (facturation précise), Stripe cherche à offrir une solution intégrée pour le routage, la mesure et le paiement de la consommation d'IA, consolidant ainsi son rôle de "caisse" et de "centre de régulation" de cette nouvelle économie.

链捕手Hier 09:04

2 mois pour passer de 8,8 à 68 milliards d'euros d'évaluation ! La plus grande plateforme de transit d'IA, OpenRouter, sur le point d'être rachetée

链捕手Hier 09:04

D'OpenSea à OpenRouter : le scénario de la « sortie en haut de cycle » d'Alex Atallah se répète ?

**OpenRouter, la plateforme d'agrégation de modèles d'IA fondée par Alex Atallah, pourrait être rachetée par Stripe pour près de 100 milliards de dollars**, selon le Wall Street Journal. Cette transaction potentielle, si elle se concrétise, marquerait le deuxième succès d'Atallah à construire une entreprise valorisée à des dizaines de milliards, après avoir cofondé la place de marché NFT OpenSea. OpenRouter, décrit comme le "Stripe de l'IA", sert de point d'accès unifié à plus de 400 modèles d'IA pour environ 10 millions d'utilisateurs. Sa croissance a été fulgurante, passant d'une valorisation de 1,3 milliard de dollars en mars 2026 à une évaluation potentielle de 100 milliards aujourd'hui. L'article souligne un parallèle avec le parcours d'Atallah chez OpenSea, qu'il a quittée avant le refroidissement du marché NFT. Aujourd'hui, face à une concurrence croissante dans l'agrégation de modèles d'IA et à une activité essentiellement basée sur des frais de plateforme (5-5,5%), la vente à un géant comme Stripe pourrait apparaître comme un choix stratégique pour "sortir au sommet". La valeur réelle d'OpenRouter pour un acquéreur résiderait moins dans ses revenus actuels que dans les vastes quantités de données d'utilisation réelle de l'IA qu'elle a accumulées. Ces informations sur les performances, les préférences des développeurs et la dynamique du marché sont un atout unique. La transaction, si elle aboutit, pose la question : s'agit-il d'une juste reconnaissance de la valeur des infrastructures d'IA ou d'un possible signal de sommet pour le secteur ?

链捕手Hier 08:47

D'OpenSea à OpenRouter : le scénario de la « sortie en haut de cycle » d'Alex Atallah se répète ?

链捕手Hier 08:47

Trading

Spot

Articles tendance

Comment acheter PEOPLE

Bienvenue sur HTX.com ! Nous vous permettons d'acheter ConstitutionDAO (PEOPLE) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément ConstitutionDAO (PEOPLE).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos ConstitutionDAO (PEOPLE)Après avoir acheté vos ConstitutionDAO (PEOPLE), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des ConstitutionDAO (PEOPLE)Tradez facilement ConstitutionDAO (PEOPLE) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

627 vues totalesPublié le 2024.12.12Mis à jour le 2026.06.02

Comment acheter PEOPLE

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de PEOPLE (PEOPLE) sont présentées ci-dessous.

活动图片