Les développeurs du monde entier paient volontairement Anthropic, la société a finalement décidé d'intervenir

marsbitXuất bản vào 2026-08-17Cập nhật gần nhất vào 2026-08-17

Tóm tắt

Anthropic a publié un guide pour aider les développeurs à réduire leurs coûts d'utilisation de Claude Code, l'outil de programmation alimenté par l'IA. L'entreprise constate que les utilisateurs gaspillent souvent des tokens (unités de calcul facturées), augmentant inutilement leurs dépenses mensuelles, qui oscillent généralement entre 150 et 250 dollars. Le coût dépend principalement des tokens d'entrée (moins chers) et de sortie (5 fois plus chers), du modèle choisi (Opus, Sonnet, Haiku) et du niveau d'effort de raisonnement. Un levier crucial d'économie est le **cache de prompt**. Lorsqu'une partie d'une conversation reste identique entre deux requêtes, elle est relue à seulement 10% de son coût initial. Ce cache est toutefois invalidé par tout changement (modèle, niveau d'effort, compression, expiration du temps). Pour optimiser les coûts, Anthropic recommande six pratiques principales : 1. Utiliser `/clear` après chaque tâche pour éviter de traîner un contexte inutile. 2. Définir le modèle et le niveau d'effort dès le début et ne pas les changer. 3. Référencer les fichiers avec `@` au lieu de taper leur chemin manuellement. 4. Ajouter des options "silencieuses" aux commandes générant de grandes sorties. 5. Utiliser `/compact` avant une pause, tant que le cache est actif. 6. Déléguer les tâches à sorties volumineuses à un sous-agent (`subagent`) pour isoler son contexte. L'accumulation non contrôlée du contenu dans l'historique (fichiers lus, sorties de commandes...

Anthropic vient tout juste de publier un article de blog.

Le message principal : Arrêtez de gaspiller vos tokens, nous en avons marre de regarder ça !

Pour cela, l'entreprise a détaillé six astuces pour économiser de l'argent. Les voici :

1. /clear une fois la tâche terminée. Après avoir corrigé un bug, effacez la conversation actuelle. Ne laissez pas les fichiers lus ou les sorties de commandes de la tâche précédente encombrer le contexte de la suivante.

2. Définissez le modèle et le niveau d'effort (effort level) dès le départ. Si vous changez en cours de route, tout le cache de prompt accumulé est invalidé et l'historique entier de la conversation doit être recalculé au prix fort.

3. Utilisez @ pour référencer les fichiers, ne tapez pas les chemins manuellement. En attachant le fichier directement au message avec @, Claude n'a pas besoin de dépenser un autre appel d'outil pour le lire. Si vous ne tapez que le nom du fichier, Claude peut d'abord le rechercher et ouvrir plusieurs fichiers pour tester, toutes ces opérations seront ajoutées à l'historique et traînées dans chaque tour suivant.

4. Ajoutez un paramètre silencieux (quiet flag) aux commandes générant beaucoup de sortie. Écrivez quelque chose comme `--reporter=dot` dans CLAUDE.md pour que la sortie des tests n'affiche qu'un résumé de quelques lignes au lieu de centaines de lignes de détails. Moins il y a de sortie, moins elle occupe de contexte.

5. Faites /compact avant une pause. Compressez la conversation tant qu'elle est encore dans le cache, le coût n'est qu'un dixième du prix normal. Si vous attendez que le cache expire après votre pause, il faudra relire et recompresser toute la conversation au prix fort.

6. Confiez les tâches à forte sortie à un sous-agent (subAgent). Le sous-agent s'exécute dans une fenêtre de contexte indépendante et ne renvoie que la conclusion. Les fichiers lus et les sorties de commandes générées pendant le processus n'entrent pas dans votre conversation principale.

La vie d'un token, de sa naissance à sa mort

Avec Claude Code, l'API fonctionne à la consommation, et l'abonnement mensuel va de 20 à 200 dollars selon trois paliers.

Selon les estimations officielles, les développeurs consomment en moyenne 13 dollars de tokens par jour, dépensant entre 150 et 250 dollars par mois.

Et ce n'est que la moyenne. Pour corriger le même bug, selon la façon de poser la question, le coût peut varier du simple au quintuple.

De plus, chaque tour de conversation renvoie l'intégralité du contenu de tous les tours précédents. Plus la session est longue, plus chaque tour est cher.

Pour comprendre où va cet argent, il faut regarder la logique de tarification des tokens.

Chaque fois que vous entrez une instruction dans Claude Code, deux choses se passent en arrière-plan.

La première est le pré-remplissage (prefill), c'est-à-dire que le modèle lit d'un coup toute votre requête, incluant le prompt système, CLAUDE.md, votre message, et tout l'historique de conversation accumulé. Ce sont des tokens d'entrée.

La seconde est le décodage (decode), c'est-à-dire le processus où le modèle écrit mot par mot, incluant sa réflexion, ses appels d'outils et le texte final que vous voyez. Ce sont des tokens de sortie.

La différence clé est ici.

Le pré-remplissage est parallèle, tous les tokens d'entrée passent par le GPU en une fois. Le décodage est séquentiel, chaque token généré nécessite une exécution du modèle. Une réponse de 200 tokens, c'est 200 calculs indépendants.

Il n'est donc pas surprenant que les tokens de sortie coûtent 5 fois plus cher que les tokens d'entrée.

Sur cette base, la facture finale dépend de deux choses.

La première est le modèle, qui détermine le prix unitaire par token.

Opus 5 : Entrée 5$/million de tokens, Sortie 25$.

Sonnet 5 : Entrée 2$, Sortie 10$.

Haiku 4.5 : Entrée 1$, Sortie 5$.

La seconde est le niveau d'effort de raisonnement, qui détermine la quantité de tokens.

Dans une session, la majorité des tokens de sortie sont des tokens de réflexion. Le niveau d'effort contrôle précisément cette quantité. Plus le niveau est élevé, plus le modèle réfléchit longtemps, et plus il génère de tokens de réflexion. La différence entre 'max' et 'low' peut être de plusieurs fois.

Utilisez Sonnet pour les tâches simples, réservez Opus pour les problèmes ardus. L'argent dépensé à utiliser un couteau suisse pour tuer une mouche est le plus mal dépensé.

Le cache de prompt, le meilleur outil pour économiser

Dans la tarification des tokens, il y a une autre variable énorme : le cache.

Chaque requête de Claude Code commence par le même préfixe : le prompt système, les définitions d'outils, CLAUDE.md et l'historique de conversation.

Si le préfixe de cette requête est identique octet par octet à celui de la précédente, le serveur ne recalcule pas, il charge directement le résultat du calcul précédent.

La lecture depuis le cache ne coûte que 0.1 fois le prix d'entrée normal, permettant d'économiser directement 90%.

L'écriture dans le cache est un peu plus chère, jusqu'à 2 fois le prix. Mais l'écriture n'a lieu qu'une seule fois, et chaque tour suivant bénéficie de la lecture à 0.1x.

Prenons un exemple.

Supposons que votre historique de conversation fasse 50 000 tokens. Sans cache, à chaque tour, simplement relire ces 50 000 tokens coûterait le prix fort. Mais si le cache est utilisé, les mêmes 50 000 tokens ne coûtent qu'un dixième.

Sur une session de vingt à trente tours, les économies cumulées grâce au cache sont astronomiques.

C'est votre plus grand levier pour optimiser les coûts.

Mais le cache a une faiblesse fatale. Il doit correspondre de manière continue depuis le premier octet de la requête. Si quoi que ce soit change au milieu, tout ce qui suit devient invalide.

Plus précisément, il y a six situations :

1. Changer de modèle avec /model : Chaque modèle a son cache indépendant. Passer de Sonnet à Opus signifie que tout l'historique de conversation doit être pré-rempli au prix d'Opus, sans remise.

2. Changer le niveau d'effort avec /effort : Le niveau d'effort fait aussi partie de la clé de cache. Après un changement, tout l'historique de conversation doit être recalculé.

3. Activer/désactiver le mode Rapide (Fast mode) : Même effet que les deux précédents, le cache est immédiatement invalidé.

4. Compresser la conversation avec /compact : La conversation est réécrite en résumé, le contenu original ne correspond plus, l'ancien cache est directement invalidé.

5. Expiration temporelle : Le cache reste actif 1 heure pour les utilisateurs abonnés, 5 minutes par défaut pour les utilisateurs de l'API. Après ce délai, le tour suivant nécessite un recalcul complet.

6. Reprendre une ancienne session : Si trop de temps s'est écoulé, le cache a disparu depuis longtemps, il faut presque à 100% recalculer au prix fort.

La mauvaise nouvelle est que si l'une de ces situations se produit, tout l'historique de conversation passe de 0.1x au prix fort.

La bonne nouvelle est qu'en sachant ce qui invalide le cache, vous savez comment le préserver.

Par exemple, verrouillez le modèle et le niveau d'effort au début de la session et ne les changez pas. Ne faites pas /compact tant que le cache est chaud, attendez d'être sur le point de faire une pause.

Il y a aussi un piège caché.

Le mode opusplan change de modèle à chaque fois qu'on y entre ou en sort. Chaque entrée invalide le cache. Chaque sortie, l'invalide à nouveau. Si vous allez et venez, chaque changement coûte un pré-remplissage au prix fort.

Votre conversation grossit en secret

Le cache vous aide à réduire le coût de renvoi de l'historique à un dixième.

Mais il y a une chose qu'il ne peut pas aider : votre historique lui-même gonfle tour après tour.

Chaque fois que Claude lit un fichier, son contenu est ajouté à la conversation. Chaque fois que Claude exécute une commande, sa sortie est aussi ajoutée. À partir du tour où c'est ajouté, chaque tour suivant le transporte.

Le 40ème tour de conversation renvoie l'intégralité du contenu accumulé des tours 1 à 39.

Cette croissance est proche d'un niveau O(n²).

Claude Code a un mécanisme de secours.

Si la sortie d'une commande dépasse 30 000 caractères, elle n'est pas mise dans la conversation, mais écrite dans un fichier temporaire, seule une phrase de résumé reste dans la conversation. Mais les sorties de moins de 30 000 caractères ne sont pas gérées.

Par exemple, un framework de tests qui termine son exécution et imprime 400 lignes de résultats positifs, chaque ligne faisant quelques dizaines de caractères, le total est inférieur à 30 000, ne déclenchant pas ce seuil.

Ainsi, ces 400 lignes restent intactes dans l'historique de conversation et sont renvoyées dans chaque tour suivant.

Face à cela, l'article de blog d'Anthropic donne plusieurs méthodes pratiques pour maigrir.

1. Référencez les fichiers avec @.

Ne tapez pas manuellement les chemins pour que Claude les trouve lui-même. @ attache le fichier directement au message, économisant une opération de lecture.

Si vous ne donnez que le nom du fichier, Claude peut d'abord faire une recherche grep, ouvrir plusieurs fichiers pour voir lequel convient. Toutes ces tentatives entreront alors dans l'historique de conversation, augmentant inutilement les coûts.

2. Ajoutez un paramètre silencieux (quiet flag) aux commandes bruyantes.

Écrivez dans CLAUDE.md : « run tests with npx vitest run --reporter=dot ». Désormais, chaque exécution de tests n'affichera que quelques lignes de points au lieu de centaines de lignes de détails. Une minute de configuration économisera des centaines de lignes de contexte à chaque session.

3. Isolez les tâches à forte sortie avec un sous-agent (subagent).

Le sous-agent s'exécute dans sa propre fenêtre de contexte indépendante et ne renvoie que la réponse finale. Les fichiers lus et les sorties de commandes générés pendant le processus sont tous jetés. Idéal pour des tâches comme « va regarder les logs pour voir s'il y a des anomalies » ou « passe-moi en revue ce gros fichier ». Vous ne voulez que la conclusion, pas le processus.

Et la règle la plus importante.

4. /clear pour changer de tâche.

Après avoir corrigé un bug, faites /clear et commencez la chose suivante. Les fichiers, sorties de commandes et explorations intermédiaires du bug précédent n'ont rien à voir avec la tâche suivante, mais si vous ne les effacez pas, ils occuperont de l'espace et consommeront des tokens à chaque tour suivant.

Si vous ne voulez pas tout vider complètement, /compact peut compresser la conversation en résumé. De dix à vingt mille tokens peuvent être réduits à mille ou trois mille.

De plus, l'article de blog mentionne une opération peu connue mais gratuite, /rewind.

Si les derniers tours sont partis dans la mauvaise direction, /rewind supprime directement ces tours, sans toucher au cache précédent.

Gérer les tokens, c'est aussi une compétence de développeur

Après avoir décomposé toutes ces opérations, vous remarquerez une tendance. Les personnes qui écrivent du code développent un nouvel ensemble de compétences.

Cela n'a rien à voir avec les frameworks ou les langages, mais c'est savoir quel modèle choisir, comment gérer le contexte, comment préserver le cache, à quel niveau régler l'effort de raisonnement.

Ces capacités n'existaient pas il y a un an. Mais aujourd'hui, elles déterminent si vous dépensez 3 dollars ou 30 dollars pour la même tâche.

Anthropic lui-même en est le meilleur exemple.

80 % de leur code est écrit par l'IA, la quantité de fusions de code a été multipliée par 8 en un an, les tests de référence sont 52 fois plus rapides. Avec une utilisation de l'IA aussi intensive, si personne ne gérait les tokens, le coût du seul raisonnement pourrait dévorer le budget.

Sous cet angle, plutôt que de présenter des astuces pour économiser de l'argent, cet article de blog parle d'un nouvel instinct que les codeurs doivent développer à l'ère de l'IA —

Comprendre ce que consomme chacune de vos actions, savoir comment faire plus de travail avec le même budget.

Ceux qui le comprennent ne récolteront pas seulement quelques dollars de tokens.

Références :

https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions

Cet article provient du compte public WeChat « 新智元 », auteur : 摩西

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QQuels sont les six conseils principaux donnés par Anthropic pour économiser sur les coûts des tokens lors de l'utilisation de Claude Code ?

A1. /clear après chaque tâche pour ne pas traîner le contexte précédent. 2. Définir le modèle et le niveau d'effort de raisonnement dès le début. 3. Utiliser @ pour référencer les fichiers au lieu de taper les chemins manuellement. 4. Ajouter des paramètres de silence (quiet flag) aux commandes générant beaucoup de sorties. 5. Effectuer /compact avant une pause, lorsque le cache est encore chaud. 6. Déléguer les tâches à forte sortie à un sous-agent (subagent).

QExpliquez la différence de coût entre les tokens d'entrée (prefill) et de sortie (decode), et pourquoi celle-ci existe.

ALes tokens d'entrée (prefill) sont traités en parallèle, liseant toute la requête d'un coup. Les tokens de sortie (decode) sont générés séquentiellement, chaque token nécessitant un calcul indépendant du modèle. Comme la génération séquentielle est beaucoup plus coûteuse en calcul, les tokens de sortie coûtent environ 5 fois plus cher que les tokens d'entrée.

QQu'est-ce que le cache de prompts (prompt caching) et comment permet-il de réaliser d'importantes économies ?

ALe cache de prompts permet de stocker le résultat du calcul des préfixes de requêtes identiques (comme l'historique de conversation). Si une nouvelle requête commence exactement par les mêmes octets, le serveur recharge le résultat mis en cache au lieu de le recalculer. La lecture depuis le cache ne coûte que 0,1 fois le prix d'entrée normal, ce qui permet d'économiser 90% sur le coût de relecture de l'historique à chaque tour de dialogue.

QÉnumérez les situations qui provoquent l'invalidation du cache et obligent à un recalcul complet au prix fort.

A1. Changer de modèle avec /model. 2. Modifier le niveau d'effort de raisonnement avec /effort. 3. Activer ou désactiver le mode rapide (Fast mode). 4. Compresser la conversation avec /compact. 5. Dépassement du temps de conservation du cache (1h pour les abonnés, 5min par défaut pour l'API). 6. Reprendre une ancienne conversation après un long délai.

QQuelles sont les techniques recommandées pour 'maigrir' une conversation et éviter une croissance quadratique des coûts ?

A1. Utiliser @ pour attacher les fichiers directement. 2. Configurer des indicateurs de silence (quiet flag) pour les commandes bruyantes via CLAUDE.md. 3. Isoler les tâches à grande sortie dans un sous-agent (subagent). 4. Utiliser /clear pour commencer une nouvelle tâche propre. 5. Utiliser /compact pour résumer une longue conversation. 6. Utiliser /rewind pour supprimer les derniers tours sans invalider le cache précédent.

Nội dung Liên quan

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

Nền tảng truyền thông xã hội X của Elon Musk đang xem xét khả năng sử dụng stablecoin để trả thưởng cho những người sáng tạo nội dung. Theo nguồn tin, X đang đàm phán về việc sử dụng stablecoin, chủ yếu là USDC, cho các khoản thanh toán này. Kế hoạch hiện vẫn đang được thảo luận và chưa có quyết định cuối cùng hay thời điểm triển khai cụ thể. Nếu được thực hiện, nó có thể cho phép các nhà sáng tạo nội dung trên toàn cầu nhận tiền nhanh hơn dưới dạng kỹ thuật số. Các chuyên gia nhận định việc sử dụng stablecoin, đặc biệt trong thanh toán xuyên biên giới, có thể trở thành một giải pháp thay thế cho các hệ thống thanh toán truyền thống. Bài báo cũng đề cập rằng SpaceX, một công ty khác của Elon Musk, đã sử dụng stablecoin để thực hiện các khoản thanh toán xuyên biên giới cho dịch vụ Starlink ở một số quốc gia. Mặc dù chưa được phê duyệt, việc X cân nhắc sử dụng các đồng tiền kỹ thuật số như USDC được coi là một tín hiệu mới về khả năng mở rộng ứng dụng của stablecoin vào các giao dịch thanh toán kỹ thuật số hàng ngày.

cryptonews.ru2 giờ trước

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

Nhà đầu tư tiền điện tử mất 1.010 ETH do truy cập trang web Tornado Cash lỗi thời bị chiếm đoạt. Các nhà phân tích từ Wu Blockchain cho biết nạn nhân đã sử dụng dấu trang trình duyệt cũ để vào trang trộn tiền điện tử, lúc này tên miền đã bị kẻ xấu kiểm soát và triển khai giao diện giả mạo. Tin rằng mình đang tương tác với hợp đồng thông minh Tornado Cash thật, nạn nhân đã cấp quyền truy cập tài sản cho bọn lừa đảo, và số tiền bị rút sạch trong vòng 12 giờ. Số tiền bị đánh cắp, hiện nằm rải rác trên nhiều địa chỉ ví do tội phạm kiểm soát, được rút thành nhiều lần nhỏ. Nhóm Tornado Cash đã mất quyền kiểm soát tên miền cũ sau lệnh trừng phạt của OFAC Mỹ năm 2022, và kể từ đó, bọn tội phạm đã đăng ký lại và vận hành trang web lừa đảo. Trong 12 tháng qua, trang web giả này được cho là đã đánh cắp tổng cộng khoảng 4.000 ETH từ nhiều người dùng. Trong bối cảnh này, các chuyên gia bảo mật Bitdefender cũng cảnh báo về phần mềm độc hại Lumma Stealer đang được phát tán dưới vỏ bọc là bản phim lậu của bộ phim "Oppenheimer" đạo diễn bởi Christopher Nolan.

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

Các nhà phân tích cho biết Quy định về Thị trường Tài sản Crypto (MiCA) của châu Âu chưa gây ra hiện tượng rút tiền hàng loạt trên toàn cầu khỏi stablecoin USDT. Dữ liệu từ Artemis Analytics và một nghiên cứu độc lập của Đại học LUISS và Đại học Surrey chỉ ra rằng việc hạn chế USDT trên các sàn giao dịch được quản lý ở châu Âu chưa dẫn đến sự sụt giảm đáng kể về nguồn cung hoặc nhu cầu toàn cầu đối với USDT. Nghiên cứu xác nhận MiCA đã thay đổi cơ cấu giao dịch trên một số nền tảng cụ thể ở châu Âu, nơi thị phần của USDC đã tăng lên sau khi USDT bị hạn chế. Tuy nhiên, thị phần và khối lượng giao dịch tổng hợp của các stablecoin hàng đầu hầu như không thay đổi trên quy mô toàn cầu. USDT vẫn giữ vị trí dẫn đầu với vốn hóa thị trường khoảng 183 tỷ USD vào cuối tháng 7. Hoạt động với USDT tiếp tục mở rộng mạnh mẽ bên ngoài châu Âu, đặc biệt trên các mạng như BNB Chain và Tron, phản ánh xu hướng áp dụng số hóa đô la trên các thị trường mới nổi. Trong khi đó, tại châu Âu, việc Tether không đăng ký theo MiCA đã khiến nhiều dịch vụ phải hạn chế USDT. Dù vậy, dữ liệu không cho thấy sự dịch chuyển thanh khoản quy mô lớn hoặc thay đổi đột ngột trùng khớp với thời điểm MiCA có hiệu lực.

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

cryptonews.ru2 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua CORE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua CORE (CORE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua CORE (CORE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ CORE (CORE) của BạnSau khi mua CORE (CORE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch CORE (CORE)Giao dịch CORE (CORE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 630Xuất bản vào 2024.12.13Cập nhật vào 2026.06.02

Làm thế nào để Mua CORE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của CORE (CORE) được trình bày dưới đây.

活动图片