Les IA commencent à appeler des IA à la place des humains, la consommation de tokens est déjà 5,2 fois supérieure

marsbitPublié le 2026-08-25Dernière mise à jour le 2026-08-25

Résumé

Le 6 février 2026 a marqué un tournant symbolique : pour la première fois sur OpenRouter, la consommation de tokens par les agents IA a égalé celle des humains. En six mois, cet écart s’est creusé, les agents utilisant désormais 5,2 fois plus de tokens que les utilisateurs humains. La plateforme OpenRouter, qui traite environ 1% du volume mondial d’inférence, distingue les flux humains des flux automatisés en analysant les comportements d’API (fréquence des appels d’outils, temps entre les requêtes, etc.). La différence fondamentale réside dans la nature des tâches : tandis qu’un utilisateur humain effectue généralement quelques échanges courts, un agent peut exécuter des processus autonomes de longue durée, déclenchant des dizaines d’appels de modèles et d’outils pour une seule mission. Cette explosion de la consommation – multipliée par 14 pour les agents en six mois – s’explique par l’adoption croissante de systèmes agentiques capables de fonctionner de manière prolongée. Bien qu’environ 70% des tokens dans une requête d’agent proviennent de contexte mis en cache (moins coûteux), le volume global fait grimper la facture. Des entreprises comme Uber ont déjà épuisé leur budget annuel d’IA en quelques mois. Le véritable enjeu n’est pas le choix du modèle, mais son intégration dans des workflows opérationnels. Les entreprises les plus avancées voient leur consommation par utilisateur actif être 8,3 fois supérieure à la moyenne, grâce à l’utilisation intensive de plugins et ...

Le 6 février 2026, l'humanité a battu une IA pour la dernière fois.

Ce jour-là, les tokens utilisés par les humains sur OpenRouter ont été rattrapés pour la première fois par ceux des agents.

En seulement six mois, l'écart entre les deux courbes s'est creusé d'un facteur 5.

Selon les statistiques d'OpenRouter, au 10 août, la consommation de tokens de type Agent est passée d'environ 0,51 mille milliards à 7,3 mille milliards, soit une multiplication par 14 ; la courbe humaine a également augmenté pour atteindre 1,4 mille milliards, mais seulement par un facteur de 2,8.

Un écart aussi important laisse Peter un peu éberlué : cela ressemble à dix ans d'écart, mais le 6 février, c'était en fait il y a seulement six mois.

Peu importe qui vous êtes, seul compte votre usage

Précisons d'abord d'où viennent ces données et comment elles sont calculées.

OpenRouter est l'une des plus grandes passerelles de modèles au monde, connectant environ 70 fournisseurs de modèles d'un côté et les développeurs de l'autre, traitant 28 mille milliards de tokens par semaine.

Selon les estimations de son cofondateur et COO, Chris Clark, cela représente environ 1 % du volume mondial d'inférence, dont la moitié provient des États-Unis.

Comment ce 1 % de tokens est-il divisé entre humains et Agents ?

OpenRouter ne regarde pas qui vous êtes, mais comment vous l'utilisez, en suivant précisément le comportement via la clé API :

Fréquence d'utilisation des outils, délai entre deux réponses, nombre d'échanges dans une conversation, etc. : au total 7 signaux sont pondérés et notés, puis le trafic est classé en trois catégories : Agentic, Mixte, Humain.

Pourquoi le comportement permet-il de faire la différence ?

La logique est simple : un humain utilise l'IA en posant une question puis en faisant une pause, le temps de lire, réfléchir et taper ; un Agent, lui, ne s'arrête jamais, enchaînant les appels d'outils et les cycles de conversation, un rythme qui ne ressemble en rien à celui d'un être carboné.

C'est donc un modèle d'estimation, mais la direction est la bonne.

Un objectif humain peut désormais déclencher des dizaines d'appels de modèles et d'outils. Les statistiques de tokens ne comptent pas le nombre de personnes utilisant l'IA, mais la profondeur du travail que l'IA accomplit pour l'homme.

Une tâche d'Agent vaut cent conversations

Ce qui creuse réellement l'écart entre l'homme et l'Agent, c'est la différence dans leur manière de l'utiliser.

À quoi ressemble une requête humaine ?

Ouvrir la boîte de dialogue, taper un prompt, attendre une réponse, la copier, fermer.

Du début à la fin, vous et le modèle n'avez échangé qu'une dizaine de phrases, représentant au mieux quelques milliers de tokens sur le papier.

Mais la requête d'un agent intelligent est d'une tout autre nature.

Vous lui donnez un objectif, et il avance tout seul : lire un fichier, appeler un outil, écrire un résultat, relire, modifier, tournant en rond jusqu'à la fin de la tâche.

L'humain fourre dans le prompt initial l'objectif, les spécifications et le contexte, et ensuite le modèle effectue des lectures et écritures incrémentielles sur ce même contexte.

Alors que vous en êtes encore à une question/réponse, un Agent peut déjà fonctionner toute une journée sur la base d'une seule instruction !

Ainsi, la même personne, qui copiait et collait manuellement dans la boîte de dialogue le matin, verra le volume de tokens changer d'ordre de grandeur l'après-midi si elle lance un agent intelligent pour exécuter la tâche.

Peter résume d'une phrase cinglante : Le véritable changement de comportement qui débloque les volumes massifs, c'est lorsque les gens commencent à laisser les agents intelligents fonctionner de manière autonome pendant de longues périodes.

Même les tokens bon marché peuvent brûler le budget

Face à une multiplication par 14, votre première réaction est probablement : ça coûte une fortune.

Et c'est vrai, mais pas de la manière dont vous l'imaginez.

Peter ajoute un point : comme les agents sont naturellement multicycles, près de 70 % des tokens d'une requête d'agent moyenne proviennent de prompts mis en cache, et le cache est généralement facturé bien moins cher.

La logique est simple à comprendre.

L'Agent effectue des lectures et écritures répétées autour du même objectif : la première fois, il ingère tout ce contexte (normes de code, manuels de procédure, liste d'outils) et paie le prix plein ; chaque cycle suivant ne fait que des mises à jour incrémentielles, et les parties déjà en cache sont facturées à une fraction du prix d'une entrée normale.

En d'autres termes, près de sept dixièmes de cette courbe raide sont constitués du même contexte réutilisé encore et encore.

Comparaison de la composition des tokens entre Agents et humains, les tokens en cache contribuent à presque tout l'incrément. a16z l'écrit comme étant >85% en termes de volume total, le post original de Peter le donne comme ~70% en moyenne par requête.

Le prix unitaire baisse effectivement, mais rien ne peut arrêter l'explosion des volumes.

Praveen Neppalli Naga, CTO d'Uber, a révélé plus tôt cette année que les ingénieurs de l'entreprise avaient épuisé en seulement quatre mois le budget annuel alloué à Claude Code.

Selon des retranscriptions médiatiques, une seule démonstration de deux heures qu'il a donnée a coûté 1200 dollars.

Prix unitaire divisé par trois, volume multiplié par 14, le résultat de cette multiplication n'est pas difficile à calculer.

EY a fait un calcul encore plus parlant : pour une même interaction de service client, le coût était d'environ 0,04 dollar en 2023, et est passé à environ 1,20 dollar en 2026, soit 30 fois plus.

Ce n'est pas que les modèles soient devenus plus chers.

Avant, c'était le client qui posait une question, le système répondait, une ligne droite du début à la fin.

Maintenant, le client pose toujours la même question, mais en coulisses, le système consulte les tickets, vérifie les stocks, parcourt les historiques, réfléchit, modifie, fait une douzaine d'allers-retours avant de produire une réponse.

La même chose, mais faite différemment, et le prix change.

Goldman Sachs estime quant à elle que l'IA agentique pourrait multiplier par 24 la consommation de tokens d'ici 2030.

Face à un coût qui quadruple en six mois, tout le monde commence à regarder de près. Peter dit que c'est précisément la raison pour laquelle les modèles open-weight et les services de tokens à bas prix attirent soudainement l'attention.

Et puis, les tokens en cache, même s'ils sont bon marché, consomment de la mémoire.

Un agent intelligent qui tourne pendant plusieurs heures, sans avoir à tout recommencer depuis le début, repose sur la mémoire qui maintient tout ce contexte en place.

Cela explique en partie pourquoi la mémoire haute bande passante (HBM) est si tendue en ce moment.

La ligne de partage n'est pas le modèle que vous utilisez

La solution pour économiser serait-elle alors de changer pour un modèle moins cher ?

La véritable ligne de partage ne se situe pas dans le modèle que vous utilisez.

Avec le même modèle, si vous l'utilisez comme une barre de recherche, vous consommez quelques milliers de tokens par jour ; si vous le connectez à vos propres fichiers, outils et à un flux de travail capable de s'exécuter en continu, il n'est pas rare d'atteindre des dizaines de millions de tokens par jour.

L'écart ne vient pas du modèle, mais du fait que vous l'intégriez ou non dans un véritable processus de travail.

Pour donner une idée de l'ampleur de ce fossé, OpenAI fournit un point de référence :

Les 10 % d'entreprises qui l'utilisent le plus profondément produisent 8,3 fois plus de tokens par utilisateur actif que les entreprises typiques. En janvier, cet écart n'était que de 2,6 fois.

En six mois, l'écart s'est plus que triplé.

Ce qui creuse l'écart, ce n'est pas le modèle, mais l'écosystème.

Dans les mêmes statistiques, 21 % des utilisateurs actifs des entreprises de tête utilisent des extensions chaque semaine, contre seulement 9 % dans les entreprises typiques ; le taux d'adoption des compétences (skills) est de 19 % contre 3 %. En interne chez OpenAI, ce chiffre est de 95 %.

En regroupant les tâches que vous effectuez régulièrement en un ensemble de compétences réutilisables, l'agent intelligent n'a pas besoin de tout redécouvrir à chaque fois.

Quelques recherches en moins, quelques retouches en moins, autant d'économies.

Les tokens sont dépensés, mais qui valide le travail ?

Cependant, des calculs aussi précis ne signifient pas pour autant que le travail est effectué en toute confiance.

L'explosion du trafic des agents intelligents ne signifie pas que l'IA agit entièrement de manière autonome. Un grand nombre de tâches sont toujours initiées par des humains, et sont souvent interrompues par des approbations manuelles.

Un développeur servant des clients du secteur des services mentionne dans les commentaires du post original de Peter que les patrons qu'il sert n'ont jamais imaginé lâcher prise : achat, envoi, signature, chaque étape doit repasser par un humain.

Mais le problème est que ce retour vers l'humain ne garantit pas toujours de trouver quelqu'un.

Un autre professionnel raconte que son agent intelligent a supprimé 18 vidéos d'un compte publicitaire, et que cela a pris toute une journée avant que quelqu'un ne s'en aperçoive.

Ce n'est pas que le modèle ait commis une erreur aberrante, c'est simplement que personne n'a surveillé cette étape.

Les dépenses en tokens peuvent être multipliées par 14 en six mois, mais le nombre de personnes chargées de la validation ne peut pas suivre la même progression. C'est probablement le poste de dépenses le plus facilement ignoré, et aussi le plus coûteux, de cette croissance.

L'analyse, la recherche, les premières ébauches, les propositions, les actions d'exécution répétitives : tout cela va devenir excédentaire.

Ce qui deviendra réellement rare, c'est la vérification, le jugement, et la décision de ce qui mérite d'être fait.

L'IA est déjà devenue le principal consommateur de tokens, mais jusqu'à aujourd'hui, elle ne peut toujours pas signer à votre place.

À l'avenir, la vraie question ne sera plus de savoir si vous utilisez l'IA ou non.

Mais plutôt : qui valide le travail que l'IA a accompli pour vous, et qui décide de la prochaine étape ?

Références :

https://www.linkedin.com/posts/peterjameswalker_february-6th-2026-potentially-the-last-share-7493029881841344512-IK89/

https://the-decoder.com/ai-is-becoming-ais-biggest-customer-as-agentic-token-usage-jumps-14x-on-openrouter/

https://openai.com/signals/enterprise-data/

https://www.a16z.news/p/charts-of-the-week-winds-of-thematic

https://www.ey.com/en_us/insights/ai/agentic-ai-token-costs

Cet article provient du compte public WeChat « 新智元 » (New Wisdom Era), auteur : ASI启示录 ; éditeur : 元宇

Questions liées

QQuel est le principal constat de l'article concernant l'utilisation des tokens par les IA et les humains en 2026 ?

AL'article constate qu'à partir du 10 août 2026, la consommation de tokens par les agents IA (7,3 billions) est devenue environ 5,2 fois supérieure à celle des humains (1,4 billions). Ce décalage s'est creusé rapidement en seulement six mois.

QComment OpenRouter distingue-t-il le trafic généré par les agents IA de celui généré par les humains ?

AOpenRouter ne regarde pas l'identité de l'utilisateur mais son comportement. En suivant des clés API, il analyse des signaux comme la fréquence d'appel d'outils, le délai entre les réponses, et le nombre de tours dans une conversation. Ces indicateurs, pondérés, permettent de classer le trafic en trois catégories : Agentic, Mixed et Human.

QPourquoi la consommation de tokens par les agents IA augmente-t-elle si rapidement par rapport aux humains ?

ALa différence vient de la nature des tâches. Les humains utilisent l'IA pour des interactions courtes (quelques questions/réponses), tandis qu'un agent IA peut exécuter une tâche complexe de manière autonome pendant des heures, effectuant de nombreux cycles de lecture, d'écriture et d'appels d'outils, ce qui génère un volume de tokens bien plus important.

QMalgré un coût par token souvent plus bas pour les agents, pourquoi la facture globale explose-t-elle ?

ABien qu'environ 70% des tokens d'une requête d'agent proviennent du cache (moins cher), le volume total d'utilisation a été multiplié par 14 en six mois. Cette augmentation exponentielle du nombre de requêtes et de tours de traitement compense largement la réduction du coût unitaire, entraînant une explosion des dépenses globales.

QQuel est le principal défi opérationnel soulevé par la montée en puissance des agents IA selon l'article ?

ALe principal défi est celui de la supervision et de la validation humaine. Alors que les agents consomment des quantités massives de tokens pour exécuter des tâches de plus en plus complexes, les capacités humaines de vérification, de jugement et de prise de décision finale ne peuvent pas suivre la même croissance, créant un risque d'erreurs ou d'actions non supervisées.

Lectures associées

Indicateur des tendances des actions liées aux cryptos丨Strategy vend des actions MSTR pour 2,007 milliards de dollars ; BitMine ajoute 32 447 ETH la semaine dernière, portant ses actifs à 14,9 milliards de dollars (25 août)

**Résumé des Marchés Crypto et Actions : Les Dernières Tendances (25 août)** La semaine dernière a vu un rebond significatif du marché crypto, avec le BTC atteignant 81 000 $ et l'ETH 2 500 $, stimulé par des perspectives réglementaires favorables aux États-Unis. Cette dynamique a profité aux actions liées aux cryptos. Dans le même temps, les hedge funds ont massivement vendu des actions américaines, notamment dans la tech, signalant une réduction de l'appétit pour le risque. **Principales nouvelles des sociétés cotées :** * **Bitcoin (BTC) :** L'achat net de BTC par les sociétés cotées (hors mineurs) a explosé de +1 431,6 % sur la semaine. La société **Strategy** a vendu pour 20,07 milliards de dollars d'actions MSTR, renforçant sa trésorerie à 6,7 milliards de dollars, tout en conservant 840 447 BTC (bénéfice papier d'environ 2,53 milliards de dollars). **Strive** a acheté 1 110 BTC. * **Ethereum (ETH) :** **BitMine** a accru ses réserves de 32 447 ETH, portant son total à près de 5,85 millions d'ETH (environ 4,8% de l'offre). Son portefeuille d'actifs (crypto, liquidités, investissements) atteint environ 14,9 milliards de dollars. * **Autres Altcoins :** **Eightco** (détenteur de WLD) a racheté 14 millions de ses propres actions. **Solmate** (SOL) a augmenté ses réserves. À l'inverse, **AIxCrypto** prévoit de sortir progressivement de ses actifs crypto pour se recentrer sur la location de robots. L'investisseur renommé **Stanley Druckenmiller** a pris des positions importantes dans **Bitdeer** (BTDR, 64,7 M$) et **Hyperliquid Strategies** (PURR, 23,1 M$), une société offrant une exposition indirecte au token HYPE. (Note : Ce contenu ne constitue pas un conseil en investissement.)

marsbitIl y a 8 mins

Indicateur des tendances des actions liées aux cryptos丨Strategy vend des actions MSTR pour 2,007 milliards de dollars ; BitMine ajoute 32 447 ETH la semaine dernière, portant ses actifs à 14,9 milliards de dollars (25 août)

marsbitIl y a 8 mins

Goldman Sachs voit d'un bon œil les plateformes de trading Crypto : les marchés de prédiction peuvent-ils soutenir un nouveau cycle ?

Les performances des actions des courtiers et des sociétés liées à la cryptomonnaie ont dépassé les attentes après la saison des résultats du deuxième trimestre. Goldman Sachs reste prudent mais optimiste pour le second semestre, misant sur la croissance structurelle du courtage traditionnel et des marchés de prédiction, ainsi qu'une reprise saisonnière en automne. Le volume des transactions de détail a baissé en juillet et août, mais des facteurs comme les introductions en bourse pourraient stimuler une reprise en septembre. Les marchés de prédiction, portés par les événements sportifs, politiques et cryptographiques, pourraient connaître un rebond plus marqué à l'automne. Le marché cryptographique reste plus fragile. Bien que la capitalisation ait récemment augmenté, les volumes de transactions continuent de baisser depuis 10 mois, et une reprise durable n'est pas encore assurée. Le manque de clarté réglementaire aux États-Unis, notamment l'absence de cadre législatif stable, reste un frein majeur à l'adoption institutionnelle. Face à la léthargie des transactions cryptographiques, les entreprises diversifient leurs revenus (prédictions, prêts, services d'abonnement) et contrôlent leurs coûts. Goldman Sachs privilégie Figure, Robinhood et Interactive Brokers pour leurs modèles plus diversifiés, et voit Coinbase comme un choix opportuniste en cas de reprise du secteur crypto. En résumé, l'optimisme de Goldman Sachs repose sur une reprise saisonnière des transactions, la croissance des marchés de prédiction et la diversification des revenus des plateformes, plutôt que sur un nouveau cycle haussier crypto immédiat. Les prochains mois seront déterminants pour valider ces hypothèses.

marsbitIl y a 12 mins

Goldman Sachs voit d'un bon œil les plateformes de trading Crypto : les marchés de prédiction peuvent-ils soutenir un nouveau cycle ?

marsbitIl y a 12 mins

Interprétation du rapport de recherche de JPMorgan : Les BPA de Marvell pour CY28 pourraient atteindre 11 $, dépassant de 14 % le consensus

Dans un rapport du 24 août, JPMorgan réitère sa surpondération sur Marvell Technology, relevant son estimation de BPA pour l'année civile 2028 à 11 dollars, dépassant de 14% le consensus de 9,64 dollars. La banque anticipe des résultats du T2 2027 (juillet) conformes ou légèrement supérieurs aux attentes, portés par la demande robuste de DSP optique (1,6T/800G), les puces de switch Teralynx 10 et la montée en puissance initiale du projet Trainium 3 d'AWS en 3 nm. Pour le T3 2027 (octobre), JPMorgan prévoit un chiffre d'affaires guidé d'environ 3,1 milliards de dollars, dépassant le consensus (3,028 milliards), avec une croissance du segment data center de 16 à 18% en séquentiel. Cette dynamique s'appuie sur l'accélération de Trainium 3, la force continue du DSP optique et des switches, l'élargissement des opportunités XPU et l'avancement du projet Maia 3 nm de Microsoft. La banque estime que les perspectives à long terme pour le data center devraient être révisées à la hausse, au-delà de la croissance de 55% actuellement guidée pour 2027. Cette révision potentielle est soutenue par six facteurs : la croissance du DSP optique, l'expansion de Teralynx 10, la montée en puissance des contrôleurs stockage/CXL, l'ampleur de Trainium 3, la visibilité sur Maia et l'élargissement du pipeline de puces associées aux XPU. Le partenariat public avec Google renforce la position stratégique de Marvell auprès des hyperscalers. JPMorgan maintient son objectif de cours à 240 dollars. Les risques identifiés incluent un possible ralentissement des dépenses en IA, l'évolution concurrentielle dans les ASIC, les fluctuations de parts de marché dans l'optique et la concentration clientèle. La banque considère que ces risques sont largement intégrés dans la valorisation, laissant un potentiel de hausse supérieur au risque de baisse.

marsbitIl y a 20 mins

Interprétation du rapport de recherche de JPMorgan : Les BPA de Marvell pour CY28 pourraient atteindre 11 $, dépassant de 14 % le consensus

marsbitIl y a 20 mins

Trading

Spot
活动图片