Les IA commencent à appeler des IA à la place des humains, la consommation de tokens est déjà 5,2 fois supérieure

marsbitPublié le 2026-08-25Dernière mise à jour le 2026-08-25

Résumé

Le 6 février 2026 a marqué un tournant symbolique : pour la première fois sur OpenRouter, la consommation de tokens par les agents IA a égalé celle des humains. En six mois, cet écart s’est creusé, les agents utilisant désormais 5,2 fois plus de tokens que les utilisateurs humains. La plateforme OpenRouter, qui traite environ 1% du volume mondial d’inférence, distingue les flux humains des flux automatisés en analysant les comportements d’API (fréquence des appels d’outils, temps entre les requêtes, etc.). La différence fondamentale réside dans la nature des tâches : tandis qu’un utilisateur humain effectue généralement quelques échanges courts, un agent peut exécuter des processus autonomes de longue durée, déclenchant des dizaines d’appels de modèles et d’outils pour une seule mission. Cette explosion de la consommation – multipliée par 14 pour les agents en six mois – s’explique par l’adoption croissante de systèmes agentiques capables de fonctionner de manière prolongée. Bien qu’environ 70% des tokens dans une requête d’agent proviennent de contexte mis en cache (moins coûteux), le volume global fait grimper la facture. Des entreprises comme Uber ont déjà épuisé leur budget annuel d’IA en quelques mois. Le véritable enjeu n’est pas le choix du modèle, mais son intégration dans des workflows opérationnels. Les entreprises les plus avancées voient leur consommation par utilisateur actif être 8,3 fois supérieure à la moyenne, grâce à l’utilisation intensive de plugins et ...

Le 6 février 2026, l'humanité a battu une IA pour la dernière fois.

Ce jour-là, les tokens utilisés par les humains sur OpenRouter ont été rattrapés pour la première fois par ceux des agents.

En seulement six mois, l'écart entre les deux courbes s'est creusé d'un facteur 5.

Selon les statistiques d'OpenRouter, au 10 août, la consommation de tokens de type Agent est passée d'environ 0,51 mille milliards à 7,3 mille milliards, soit une multiplication par 14 ; la courbe humaine a également augmenté pour atteindre 1,4 mille milliards, mais seulement par un facteur de 2,8.

Un écart aussi important laisse Peter un peu éberlué : cela ressemble à dix ans d'écart, mais le 6 février, c'était en fait il y a seulement six mois.

Peu importe qui vous êtes, seul compte votre usage

Précisons d'abord d'où viennent ces données et comment elles sont calculées.

OpenRouter est l'une des plus grandes passerelles de modèles au monde, connectant environ 70 fournisseurs de modèles d'un côté et les développeurs de l'autre, traitant 28 mille milliards de tokens par semaine.

Selon les estimations de son cofondateur et COO, Chris Clark, cela représente environ 1 % du volume mondial d'inférence, dont la moitié provient des États-Unis.

Comment ce 1 % de tokens est-il divisé entre humains et Agents ?

OpenRouter ne regarde pas qui vous êtes, mais comment vous l'utilisez, en suivant précisément le comportement via la clé API :

Fréquence d'utilisation des outils, délai entre deux réponses, nombre d'échanges dans une conversation, etc. : au total 7 signaux sont pondérés et notés, puis le trafic est classé en trois catégories : Agentic, Mixte, Humain.

Pourquoi le comportement permet-il de faire la différence ?

La logique est simple : un humain utilise l'IA en posant une question puis en faisant une pause, le temps de lire, réfléchir et taper ; un Agent, lui, ne s'arrête jamais, enchaînant les appels d'outils et les cycles de conversation, un rythme qui ne ressemble en rien à celui d'un être carboné.

C'est donc un modèle d'estimation, mais la direction est la bonne.

Un objectif humain peut désormais déclencher des dizaines d'appels de modèles et d'outils. Les statistiques de tokens ne comptent pas le nombre de personnes utilisant l'IA, mais la profondeur du travail que l'IA accomplit pour l'homme.

Une tâche d'Agent vaut cent conversations

Ce qui creuse réellement l'écart entre l'homme et l'Agent, c'est la différence dans leur manière de l'utiliser.

À quoi ressemble une requête humaine ?

Ouvrir la boîte de dialogue, taper un prompt, attendre une réponse, la copier, fermer.

Du début à la fin, vous et le modèle n'avez échangé qu'une dizaine de phrases, représentant au mieux quelques milliers de tokens sur le papier.

Mais la requête d'un agent intelligent est d'une tout autre nature.

Vous lui donnez un objectif, et il avance tout seul : lire un fichier, appeler un outil, écrire un résultat, relire, modifier, tournant en rond jusqu'à la fin de la tâche.

L'humain fourre dans le prompt initial l'objectif, les spécifications et le contexte, et ensuite le modèle effectue des lectures et écritures incrémentielles sur ce même contexte.

Alors que vous en êtes encore à une question/réponse, un Agent peut déjà fonctionner toute une journée sur la base d'une seule instruction !

Ainsi, la même personne, qui copiait et collait manuellement dans la boîte de dialogue le matin, verra le volume de tokens changer d'ordre de grandeur l'après-midi si elle lance un agent intelligent pour exécuter la tâche.

Peter résume d'une phrase cinglante : Le véritable changement de comportement qui débloque les volumes massifs, c'est lorsque les gens commencent à laisser les agents intelligents fonctionner de manière autonome pendant de longues périodes.

Même les tokens bon marché peuvent brûler le budget

Face à une multiplication par 14, votre première réaction est probablement : ça coûte une fortune.

Et c'est vrai, mais pas de la manière dont vous l'imaginez.

Peter ajoute un point : comme les agents sont naturellement multicycles, près de 70 % des tokens d'une requête d'agent moyenne proviennent de prompts mis en cache, et le cache est généralement facturé bien moins cher.

La logique est simple à comprendre.

L'Agent effectue des lectures et écritures répétées autour du même objectif : la première fois, il ingère tout ce contexte (normes de code, manuels de procédure, liste d'outils) et paie le prix plein ; chaque cycle suivant ne fait que des mises à jour incrémentielles, et les parties déjà en cache sont facturées à une fraction du prix d'une entrée normale.

En d'autres termes, près de sept dixièmes de cette courbe raide sont constitués du même contexte réutilisé encore et encore.

Comparaison de la composition des tokens entre Agents et humains, les tokens en cache contribuent à presque tout l'incrément. a16z l'écrit comme étant >85% en termes de volume total, le post original de Peter le donne comme ~70% en moyenne par requête.

Le prix unitaire baisse effectivement, mais rien ne peut arrêter l'explosion des volumes.

Praveen Neppalli Naga, CTO d'Uber, a révélé plus tôt cette année que les ingénieurs de l'entreprise avaient épuisé en seulement quatre mois le budget annuel alloué à Claude Code.

Selon des retranscriptions médiatiques, une seule démonstration de deux heures qu'il a donnée a coûté 1200 dollars.

Prix unitaire divisé par trois, volume multiplié par 14, le résultat de cette multiplication n'est pas difficile à calculer.

EY a fait un calcul encore plus parlant : pour une même interaction de service client, le coût était d'environ 0,04 dollar en 2023, et est passé à environ 1,20 dollar en 2026, soit 30 fois plus.

Ce n'est pas que les modèles soient devenus plus chers.

Avant, c'était le client qui posait une question, le système répondait, une ligne droite du début à la fin.

Maintenant, le client pose toujours la même question, mais en coulisses, le système consulte les tickets, vérifie les stocks, parcourt les historiques, réfléchit, modifie, fait une douzaine d'allers-retours avant de produire une réponse.

La même chose, mais faite différemment, et le prix change.

Goldman Sachs estime quant à elle que l'IA agentique pourrait multiplier par 24 la consommation de tokens d'ici 2030.

Face à un coût qui quadruple en six mois, tout le monde commence à regarder de près. Peter dit que c'est précisément la raison pour laquelle les modèles open-weight et les services de tokens à bas prix attirent soudainement l'attention.

Et puis, les tokens en cache, même s'ils sont bon marché, consomment de la mémoire.

Un agent intelligent qui tourne pendant plusieurs heures, sans avoir à tout recommencer depuis le début, repose sur la mémoire qui maintient tout ce contexte en place.

Cela explique en partie pourquoi la mémoire haute bande passante (HBM) est si tendue en ce moment.

La ligne de partage n'est pas le modèle que vous utilisez

La solution pour économiser serait-elle alors de changer pour un modèle moins cher ?

La véritable ligne de partage ne se situe pas dans le modèle que vous utilisez.

Avec le même modèle, si vous l'utilisez comme une barre de recherche, vous consommez quelques milliers de tokens par jour ; si vous le connectez à vos propres fichiers, outils et à un flux de travail capable de s'exécuter en continu, il n'est pas rare d'atteindre des dizaines de millions de tokens par jour.

L'écart ne vient pas du modèle, mais du fait que vous l'intégriez ou non dans un véritable processus de travail.

Pour donner une idée de l'ampleur de ce fossé, OpenAI fournit un point de référence :

Les 10 % d'entreprises qui l'utilisent le plus profondément produisent 8,3 fois plus de tokens par utilisateur actif que les entreprises typiques. En janvier, cet écart n'était que de 2,6 fois.

En six mois, l'écart s'est plus que triplé.

Ce qui creuse l'écart, ce n'est pas le modèle, mais l'écosystème.

Dans les mêmes statistiques, 21 % des utilisateurs actifs des entreprises de tête utilisent des extensions chaque semaine, contre seulement 9 % dans les entreprises typiques ; le taux d'adoption des compétences (skills) est de 19 % contre 3 %. En interne chez OpenAI, ce chiffre est de 95 %.

En regroupant les tâches que vous effectuez régulièrement en un ensemble de compétences réutilisables, l'agent intelligent n'a pas besoin de tout redécouvrir à chaque fois.

Quelques recherches en moins, quelques retouches en moins, autant d'économies.

Les tokens sont dépensés, mais qui valide le travail ?

Cependant, des calculs aussi précis ne signifient pas pour autant que le travail est effectué en toute confiance.

L'explosion du trafic des agents intelligents ne signifie pas que l'IA agit entièrement de manière autonome. Un grand nombre de tâches sont toujours initiées par des humains, et sont souvent interrompues par des approbations manuelles.

Un développeur servant des clients du secteur des services mentionne dans les commentaires du post original de Peter que les patrons qu'il sert n'ont jamais imaginé lâcher prise : achat, envoi, signature, chaque étape doit repasser par un humain.

Mais le problème est que ce retour vers l'humain ne garantit pas toujours de trouver quelqu'un.

Un autre professionnel raconte que son agent intelligent a supprimé 18 vidéos d'un compte publicitaire, et que cela a pris toute une journée avant que quelqu'un ne s'en aperçoive.

Ce n'est pas que le modèle ait commis une erreur aberrante, c'est simplement que personne n'a surveillé cette étape.

Les dépenses en tokens peuvent être multipliées par 14 en six mois, mais le nombre de personnes chargées de la validation ne peut pas suivre la même progression. C'est probablement le poste de dépenses le plus facilement ignoré, et aussi le plus coûteux, de cette croissance.

L'analyse, la recherche, les premières ébauches, les propositions, les actions d'exécution répétitives : tout cela va devenir excédentaire.

Ce qui deviendra réellement rare, c'est la vérification, le jugement, et la décision de ce qui mérite d'être fait.

L'IA est déjà devenue le principal consommateur de tokens, mais jusqu'à aujourd'hui, elle ne peut toujours pas signer à votre place.

À l'avenir, la vraie question ne sera plus de savoir si vous utilisez l'IA ou non.

Mais plutôt : qui valide le travail que l'IA a accompli pour vous, et qui décide de la prochaine étape ?

Références :

https://www.linkedin.com/posts/peterjameswalker_february-6th-2026-potentially-the-last-share-7493029881841344512-IK89/

https://the-decoder.com/ai-is-becoming-ais-biggest-customer-as-agentic-token-usage-jumps-14x-on-openrouter/

https://openai.com/signals/enterprise-data/

https://www.a16z.news/p/charts-of-the-week-winds-of-thematic

https://www.ey.com/en_us/insights/ai/agentic-ai-token-costs

Cet article provient du compte public WeChat « 新智元 » (New Wisdom Era), auteur : ASI启示录 ; éditeur : 元宇

Questions liées

QQuel est le principal constat de l'article concernant l'utilisation des tokens par les IA et les humains en 2026 ?

AL'article constate qu'à partir du 10 août 2026, la consommation de tokens par les agents IA (7,3 billions) est devenue environ 5,2 fois supérieure à celle des humains (1,4 billions). Ce décalage s'est creusé rapidement en seulement six mois.

QComment OpenRouter distingue-t-il le trafic généré par les agents IA de celui généré par les humains ?

AOpenRouter ne regarde pas l'identité de l'utilisateur mais son comportement. En suivant des clés API, il analyse des signaux comme la fréquence d'appel d'outils, le délai entre les réponses, et le nombre de tours dans une conversation. Ces indicateurs, pondérés, permettent de classer le trafic en trois catégories : Agentic, Mixed et Human.

QPourquoi la consommation de tokens par les agents IA augmente-t-elle si rapidement par rapport aux humains ?

ALa différence vient de la nature des tâches. Les humains utilisent l'IA pour des interactions courtes (quelques questions/réponses), tandis qu'un agent IA peut exécuter une tâche complexe de manière autonome pendant des heures, effectuant de nombreux cycles de lecture, d'écriture et d'appels d'outils, ce qui génère un volume de tokens bien plus important.

QMalgré un coût par token souvent plus bas pour les agents, pourquoi la facture globale explose-t-elle ?

ABien qu'environ 70% des tokens d'une requête d'agent proviennent du cache (moins cher), le volume total d'utilisation a été multiplié par 14 en six mois. Cette augmentation exponentielle du nombre de requêtes et de tours de traitement compense largement la réduction du coût unitaire, entraînant une explosion des dépenses globales.

QQuel est le principal défi opérationnel soulevé par la montée en puissance des agents IA selon l'article ?

ALe principal défi est celui de la supervision et de la validation humaine. Alors que les agents consomment des quantités massives de tokens pour exécuter des tâches de plus en plus complexes, les capacités humaines de vérification, de jugement et de prise de décision finale ne peuvent pas suivre la même croissance, créant un risque d'erreurs ou d'actions non supervisées.

Lectures associées

La fin de la cryptographie traditionnelle : comment Ethereum se prépare à l'ère de l'informatique quantique

Les développeurs d'Ethereum ont proposé une nouvelle méthode pour accepter les dépôts de staking, visant à préparer le réseau à l'ère de l'informatique quantique. Actuellement, la sécurité des cryptomonnaies repose sur la cryptographie à courbes elliptiques, vulnérable face à des ordinateurs quantiques suffisamment puissants qui pourraient calculer une clé privée à partir d'une clé publique. Les estimations sur l'émergence de cette menace varient. Une étude de Google en mars 2026 a considérablement rapproché les échéances, tandis que d'autres experts estiment qu'il reste au moins une décennie. Néanmoins, les grands blockchains comme Solana, XRP Ledger et Ethereum anticipent déjà cette transition. La nouvelle proposition introduit un contrat de dépôt plus flexible, capable d'accepter des clés de différents types et tailles (jusqu'à 8192 octets). Chaque dépôt est identifié par un marqueur spécifiant le type de cryptographie utilisé. Le système de transmission des données de dépôt est également repensé en interne. Une transition en trois étapes est prévue : désactivation initiale des nouveaux dépôts, réactivation avec l'ancien format, puis basculement définitif et irréversible vers de nouveaux algorithmes post-quantiques via une future mise à jour. Cette proposition, encore à l'état de brouillon, ne résout pas directement la vulnérabilité spécifique d'Ethereum où les clés publiques exposées dans la blockchain restent permanentes. Elle prépare plutôt l'infrastructure à un changement futur des algorithmes de signature. La question de la protection des millions de clés déjà publiées reste ouverte et pourrait nécessiter un mécanisme de rotation distinct.

cryptonews.ruIl y a 8 mins

La fin de la cryptographie traditionnelle : comment Ethereum se prépare à l'ère de l'informatique quantique

cryptonews.ruIl y a 8 mins

Une amende de 1,4 billion de dollars infligée à Meta : les algorithmes de recommandation sur le banc des accusés, l'ère post-internet va-t-elle changer les règles ?

Un tribunal fédéral d’Oakland, en Californie, examine un procès historique intenté par 29 États américains contre Meta, accusé d’avoir conçu ses plateformes (Facebook, Instagram) pour rendre les enfants et adolescents dépendants, et d’avoir collecté des données de moins de 13 ans sans consentement parental. Les États réclament jusqu’à 1 400 milliards de dollars d’amendes. L’accusation se fonde sur les lois de protection des consommateurs et sur la loi COPPA (protection de la vie privée en ligne des enfants). Elle cible délibérément la conception des plateformes — algorithmes de recommandation, défilement infini, boucles de récompenses sociales — contournant ainsi la protection habituelle de la Section 230, qui exempte les plateformes de responsabilité pour le contenu des utilisateurs. Meta conteste fermement ces allégations, les qualifiant de sans preuve et les calculs d’amende d’exagérés. Le PDG Mark Zuckerberg et le responsable d’Instagram, Adam Mosseri, doivent témoigner. Au-delà de l’amende, les États demandent des modifications structurelles des plateformes : suppression du "like", limitation du défilement, plafonds d’âge et de temps d’écran. Une victoire créerait un précédent juridique applicable à d’autres géants du numérique (TikTok, YouTube, Snapchat) et à tout modèle économique reposant sur l’engagement algorithmique, y compris l’IA générative et les jeux. Le procès, qui durera six semaines, pourrait redéfinir la responsabilité des plateformes concernant la conception de leurs produits et imposer une "décote réglementaire" permanente aux entreprises fondées sur la recommandation algorithmique.

marsbitIl y a 16 mins

Une amende de 1,4 billion de dollars infligée à Meta : les algorithmes de recommandation sur le banc des accusés, l'ère post-internet va-t-elle changer les règles ?

marsbitIl y a 16 mins

L'échange de Bitcoin Coinbase annonce l'ajout de deux altcoins sur sa plateforme de trading au comptant ! Voici les détails

La bourse de crypto-monnaie Coinbase a annoncé son intention d'ajouter deux nouveaux actifs développés sur le réseau Base à sa plateforme de trading au comptant : Basecat (BASECAT) et DebtReliefBot (DRB). Les paires de trading BASECAT-USD et DRB-USD seront proposées dans les régions prises en charge, sous réserve du respect des conditions nécessaires de liquidité. L'échange a souligné que le lancement dépendrait des conditions du marché et d'une liquidité suffisante. Base, un réseau Layer 2 d'Ethereum développé par Coinbase, héberge ces projets pour offrir des coûts de transaction bas et un débit élevé. Les investisseurs particuliers pourront accéder aux nouvelles paires via le site web, l'application mobile et la plateforme avancée Coinbase Advanced, tandis que les clients institutionnels pourront trader via Coinbase Exchange. Cette inscription élargit l'accès des investisseurs à de nouveaux projets et offre aux actifs une base d'utilisateurs plus large, mais le trading ne sera pas nécessairement disponible dans toutes les régions. Bien qu'aucun calendrier précis n'ait été communiqué, Coinbase a indiqué que le lancement pourrait être progressif après avoir rempli les conditions de liquidité. Cette démarche augmente la visibilité des jetons de l'écosystème Base sur les principales bourses centralisées. Coinbase rappelle aux investisseurs de se renseigner sur les réseaux de jetons, leur liquidité et les risques associés avant toute transaction, et précise qu'il ne s'agit pas d'une recommandation d'investissement.

cryptonews.ruIl y a 23 mins

L'échange de Bitcoin Coinbase annonce l'ajout de deux altcoins sur sa plateforme de trading au comptant ! Voici les détails

cryptonews.ruIl y a 23 mins

Trading

Spot
活动图片