AI开始替人类调用AI,token用量已是人类5.2倍

marsbit發佈於 2026-08-25更新於 2026-08-25

文章摘要

2026年2月6日,人类最后一次在AI调用量上领先。根据OpenRouter的统计数据,自那天智能体(Agent)的token用量追平人类后,仅半年时间,其用量已增长至人类的5.2倍,涨幅达14倍,而人类用量仅增长2.8倍。 数据基于API使用行为的七项信号(如工具调用频率、响应间隔等)估算,将流量分为智能体、混合和人类三类。智能体用量激增的关键在于使用方式的根本改变:人类使用多为简短问答,而智能体能够根据单一目标,自主进行多轮工具调用、文件读写和迭代,单次任务即可消耗大量token。 尽管智能体请求中近70%的token来自可重复利用的缓存提示(成本较低),但总量暴涨依然导致开支剧增。例如,Uber工程师四个月用尽全年Claude Code预算,EY测算显示单次客服交互成本从2023年的0.04美元涨至2026年的约1.20美元。 分析指出,真正的分水岭并非模型本身,而是如何将其集成到工作流中。深度使用的公司,其用户token输出量是典型公司的8.3倍,差距在半年内扩大三倍以上,关键在于配套技能和插件的广泛应用。 随着智能体承担更多工作,新的挑战浮现:大量任务仍需人工发起或审批,但验收环节的人力并未同步增长,导致监管缺失,例如有智能体误删广告视频一天后才被发现。文章最后指出,未来的核心问题已非是否使用AI,而是如何有效验收和决策AI完成的工作。

2026年2月6日,人类最后一次跑赢AI。

那天,人类在OpenRouter上用掉的token,第一次被智能体追平。

才半年时间,两条线已经拉开了5倍差距。

据OpenRouter统计,截至8月10日,Agent类token用量从约0.51万亿涨到7.3万亿,14倍;人类那条线也涨到了1.4万亿,但只有2.8倍。

如此大的落差,让Peter都有点恍惚:像是隔了10年,可2月6日,其实只是半年前。

不不看你是谁,只看你怎么用

先说清楚,这组数据打哪儿来、怎么算的。

OpenRouter是全球最大的模型网关之一,一头接着约70家模型供应商,一头接着开发者,一周要处理28万亿token。

按它的联合创始人兼COO Chris Clark估算,这大约是全球推理量的1%,其中一半来自美国。

这1%的token,又是怎么分出哪些是人、哪些是Agent的?

OpenRouter不看你是谁,只看你怎么用,具体办法是按API key追踪行为:

工具调用得勤不勤,两次响应之间隔几秒,一轮对话来回几次,这样的信号一共7项,加权打个分,再把流量分成Agentic、Mixed、Human三档。

为什么看行为就能分出来?

道理很简单,人类用AI是问一句歇一会儿,中间要读、要想、要打字;Agent则是一刻不停,工具连着调,回合循环跑,这节奏一看就不是碳基生物。

所以它是一套估算模型,但方向不会错。

一个人类目标,如今可能触发几十轮模型调用和工具调用。token统计的不是有多少人在用AI,而是AI替人干了多深的活。

一个Agent任务,顶一百次聊天

真正拉开人和Agent差距的,是双方用法的不同。

人类的请求长什么样?

打开对话框,敲一段提示词,等一段回答,复制走,关掉。

从头到尾,你和模型总共说了不到十句话,账面上撑死几千个token。

但智能体的请求,完全是另一副样子。

你给它一个目标,它就自己往下走了:读文件、调工具、写结果、再读、再改,一圈一圈磨到任务收尾。

人类在起手那段提示词里塞满了目标、规范和上下文,之后模型就在这份上下文上不断增量读写。

当你还在一问一答时,Agent已经能靠一句话跑一整天!

所以,同一个人,上午还在对话框里手动复制粘贴,下午挂上一个智能体去跑,token账面立马就会换一个数量级。

Peter的话一针见血:真正解锁量级的行为变化,是人们开始让智能体长时间自主运行。

再便宜的token,也能烧穿预算

看到14倍,你的第一反应可能是烧钱。

确实是烧钱,但不是你想的那种烧法。

Peter补充了一条:因为智能体天然是多轮的,平均一次智能体请求里,近70%的token来自缓存提示,而缓存的计价通常低得多。

道理不难懂。

Agent做的是围绕同一个目标反复读写:第一次把那一大堆上下文(代码规范、操作手册、工具清单)灌进去,付一次全价;之后每一轮只做增量更新,命中缓存的部分只按正常输入价的一小部分收。

换句话说,那条陡峭的曲线里,有近七成是被反复复用的同一段上下文。

Agent与人类的token构成对比,缓存token几乎贡献了全部增量。a16z按总量口径写作85%以上,Peter原帖按单次请求平均为近70%。

这样单价确实降下来了,但架不住用量狂飙。

Uber CTO Praveen Neppalli Naga今年早些时候透露,公司工程师只用四个月就烧完了全年的Claude Code预算。

据媒体转述,他本人一场两小时的演示,就花掉了1200美元。

单价打三折,用量涨14倍,这道乘法的结果并不难算。

EY算过一笔更直观的账:同样一次客服交互,2023年成本约0.04美元,到2026年涨到约1.20美元,30倍。

不是模型变贵了。

以前是客户问一句、系统答一句,一条线走到底。

现在客户还是问那一句,但背后已经是查工单、调库存、翻记录,想一轮改一轮,折腾十几个回合才吐出一句回复。

相同的事,干法变了,价钱就变了。

高盛则估算,智能体AI可能把2030年的token消耗推高24倍。

任何一项成本半年涨14倍,人们都会开始细抠。Peter说,这正是开放权重模型和低价token服务突然被人盯上的原因。

而且,缓存token虽然便宜,它可是要吃内存的。

智能体一跑好几个钟头,从头到尾不必重来一遍,靠的就是内存把那一整摊上下文托着。

高带宽内存最近为什么这么紧俏,这里也能找到一半答案。

分水岭不在你用哪个模型

那省钱的办法,是不是换个便宜点的模型?

真正的分水岭,不在你用哪个模型。

同一个模型,你拿它当搜索框用,一天几千token;你把它接上自己的文件、工具和一条能连续跑下去的流程,一天几千万token也不稀奇。

差距不在模型,而在你有没有把它放进真正的活里。

这个鸿沟有多大,OpenAI给出的一组可以当参照:

用得最深的10%的公司,每名活跃用户输出的token,是典型公司的8.3倍。1月份这个差距还只有2.6倍。

半年时间,差距扩大到原来的三倍以上。

拉开差距的不是模型,是配套。

同一批统计里,头部公司的活跃用户每周有21%在用插件,典型公司只有9%;技能的采用率是19%对3%。OpenAI自己内部,这个数字是95%。

把你常做的那几件事打包成一套可复用的技能,智能体就不必每次都从头摸索一遍。

少搜几次、少返工几次,省下的都是钱。

token花了,谁来验收

不过,账算得再精,也不等于这活干得放心。

智能体流量暴涨,并不等于AI全在自主行动。大量任务仍然是人发起的,中间常常还卡着人工审批。

Peter原帖评论区一位做服务业客户的开发者提到,他服务的那些老板,从来没想过撒手不管,采购、发送、签字,每一步都要绕回人。

但问题是,绕回来未必真的能找到人。

另一位从业者说,他们的智能体删掉了广告账户里的18个视频,整整一天之后才被人发现。

这不是模型犯了多离谱的错,而是根本没人去看那一步。

token花销可以在半年里翻14倍,验收的人手却翻不了这么多。这大概是这轮增长里最容易被忽略、也最昂贵的一笔账。

分析、调研、初稿、方案,重复的执行动作往后都会过剩。

真正稀缺的,是验证、判断,以及决定什么才值得被做。

AI已经成了token的主要消费方,可到今天为止,它还不能替你签字。

未来,真正的问题不再是你用不用AI。

而是AI替你干完的那些活,谁来验收,谁来拍板下一步。

参考资料:

https://www.linkedin.com/posts/peterjameswalker_february-6th-2026-potentially-the-last-share-7493029881841344512-IK89/

https://the-decoder.com/ai-is-becoming-ais-biggest-customer-as-agentic-token-usage-jumps-14x-on-openrouter/

https://openai.com/signals/enterprise-data/

https://www.a16z.news/p/charts-of-the-week-winds-of-thematic

https://www.ey.com/en_us/insights/ai/agentic-ai-token-costs

本文来自微信公众号“新智元”,作者:ASI启示录;编辑:元宇

相關問答

Q根据OpenRouter的数据,目前Agent与人类在token使用量上的差距有多大?

A截至2026年8月10日,Agent类token用量是人类的约5.2倍(Agent为7.3万亿,人类为1.4万亿)。

QOpenRouter是如何区分token是来自人类使用还是AI智能体(Agent)使用的?

AOpenRouter不直接识别用户身份,而是通过追踪API key的使用行为来区分。它依据7项行为信号(如工具调用频率、响应间隔、对话轮次等)进行加权打分,将流量划分为Agentic、Mixed和Human三档。因为人类使用通常是间歇性的,而智能体则是连续、密集地调用工具和进行多轮对话。

Q文章中提到的Uber工程师在AI使用上遇到了什么成本问题?

AUber的工程师在2026年仅用了四个月就烧完了公司全年的Claude Code预算。其CTO在之前的一场两小时演示中,就花费了1200美元,凸显了智能体应用带来的token用量激增和成本压力。

Q为什么Agent的token用量激增,但平均单价可能更低?

A因为智能体的任务通常是长时间、多轮次围绕同一目标运行。在第一次调用时,需要将大量上下文(如代码规范、操作手册)完整输入,支付全价。之后的每一轮增量更新中,大量内容来自缓存,而缓存的计价远低于正常输入。因此,虽然总用量飙升,但平均单价被拉低了。

Q文章指出,随着AI智能体广泛使用,未来最稀缺和最需要人类把关的环节是什么?

A未来最稀缺的环节是验证、判断和决策。即使AI智能体能够自主执行大量任务,但关键节点的审批、结果验收以及决定下一步行动等责任,仍然需要人类来承担。文章举例,曾有智能体在无人监督的情况下误删广告视频一天后才被发现,这凸显了人工监督和验收的重要性。

你可能也喜歡

高盛看好Crypto券商交易平台:预测市场能撑起新周期吗?

高盛近期发布报告,对券商与加密相关股票板块持谨慎乐观态度。报告指出,该板块二季度业绩超预期,股价表现优于大盘。支撑乐观判断的核心并非加密交易复苏,而是传统经纪业务与预测市场具备结构性增长与秋季季节性修复空间。当前板块估值处于五年低位,提供了安全边际。 报告分析,夏季零售交易量虽环比下降,但经账户增长调整后,单位账户交易量仍低于2021年高点,且融资余额占客户资产比例也较低,表明本轮周期可能尚未见顶。随着9月季节性因素消退及股票发行活动滞后推动,传统经纪业务有望改善。 预测市场被视作关键增长点,其交易量在过去两年多增长超十倍,主要由体育、加密和政治合约驱动。秋季体育赛事恢复与中期选举临近,可能推动交易量显著回升。 加密交易方面则更为谨慎。尽管近期加密资产市值反弹,但交易量持续萎缩,且下行持续时间已超历史中位数。交易量能否随价格企稳而复苏仍需观察。监管层面,国会立法进展缓慢是机构资金大规模进入的主要障碍。 在加密交易低迷背景下,相关公司通过控费和发展新业务稳定盈利。高盛首选业务更多元化的Figure、Robinhood和Interactive Brokers,将Coinbase视为加密市场复苏时的弹性标的。报告最终押注于这些平台拓展的不依赖单一加密周期的新收入来源(如预测市场、全球账户、贷款等)能否在未来持续支撑增长。

marsbit12 分鐘前

高盛看好Crypto券商交易平台:预测市场能撑起新周期吗?

marsbit12 分鐘前

交易

現貨
活动图片