Claude Code到底有多费token?对比实验来了:三大框架最多差30倍

marsbit发布于2026-07-31更新于2026-07-31

文章摘要

近期一项关于AI Agent框架的对比实验揭示了不同框架在资源消耗上的巨大差异。实验使用同一模型Kimi K3,在Claude Code、Hermes和Kimi Code三个框架上运行28个相同任务。结果显示,任务成功率相近,但Claude Code的Token消耗量远超其他框架——其中位数Token用量高达34万,是Kimi Code(约6.1万)的6倍,极端情况下差距可达30倍。这直接导致成本差异显著:按Kimi K3定价估算,平均单任务成本约为Kimi Code 0.22美元、Hermes 0.28美元、Claude Code则达2美元。 分析指出,Claude Code的高消耗主要源于其设计机制会在多轮交互中反复向模型输入大量历史上下文(包括消息、工具调用及文件内容),导致输入Token激增,而非输出内容更多。实验进一步印证了近期研究趋势:在模型能力趋同的背景下,Agent的编排层(Harness)已成为影响效率和成本的关键因素。有研究显示,仅优化Harness就可使平均任务成本降低41%、延迟缩短44%、Token消耗减少38%,而任务质量保持稳定。 这表明,AI Agent领域的竞争重点正从“能否完成任务”转向“谁能以更高效、经济的方式完成”。未来,评估框架时需引入“Harness税”等成本维度,框架本身的优化能力可能比模型选择更为重要。

大家都说 Claude Code 浪费 Token,究竟有多费?这回终于有人算出数来了。

最近有个挺有意思的对比实验,来自 Composio 团队。他们用同一个模型 Kimi K3,分别放进三个不同的 agent 框架(harness)里跑 ——Claude Code、Hermes 和 Kimi Code—— 一共测了 28 个完全相同的任务。

结果,三个 harness 完成任务的成功率差不多: Kimi Code 是 28 个里成功 22 个,Hermes 是 21 个,Claude Code 是 20 个。差距不算大。

真正拉开差距的,是 token 消耗。同样一个任务,用不同 harness 跑下来,token 用量最多能差到 30 倍!

中位数来看, Kimi Code 大约用 6.1 万 token,Hermes 大概 6.7 万,而 Claude Code 直接飙到 34 万,差不多是 Kimi Code 的 6 倍。

按 Kimi K3 每百万输入 token 3 美元的价格算(agent 工作流里输入 token 通常占到 95% 左右),平均每个任务的成本大概是: Kimi Code 0.22 美元,Hermes 0.28 美元,Claude Code 则到了 2 美元。差距很明显。

速度方面也不一样。中位数耗时,Hermes 最快,179 秒; Kimi Code 297 秒;Claude Code 348 秒。

所以最快的是 Hermes,最省 token 的是 Kimi Code,两者并不重合。

Composio 团队由此得出一个直接的结论:如果你想降低 agent 的成本,先看看用的是哪个 harness,而不是急着换模型。他们的数据里,harness 本身就能把成本拉开 9 倍,而模型的能力表现其实差不多。

Sebastian Raschka 看到这个结果后也发了帖,说这和他之前用 Qwen3.6 做的观察类似:Claude Code 在成功率相近的情况下,token 用量往往是其他很多 harness 的 2 到 3 倍。

他提出了几个可能的原因:是没怎么优化?是有 bug?还是故意设计成这样(因为在更难的任务上可能有帮助)?他表示需要再花时间仔细查一下。

接着他补充了上个月自己写本地 coding agent 文章时的观察。当时他分析过为什么 Claude Code 用更多 token,发现差异主要出在输入 token,而不是输出 token。也就是说,Claude 并没有多写一倍的内容。日志显示,Claude 的 harness 在多轮交互中会反复把更多上下文塞回模型,包括之前的消息、工具调用、命令输出和文件内容。举个例子,某次 Claude 跑完大约用了 57.8 万输入 token,但输出只有大约 4500 token,跨了 25 轮。所以更可能的解释是,Claude 的 harness 在多步 agent 运行时,会累积或计入更大的 prompt 端历史。

这些测试结果似乎揭示了一个不容忽视的趋势:harness 的重要性已经不亚于模型本身

最近的一篇论文(来自 Writer,一家做企业级 AI Agent 平台的公司)系统揭示了这一点:它用控制变量实验证明,换一套 harness 层比换模型更能砍成本,而且所有模型都受益。

具体来说,他们开展了一项严格的「控制变量」实验:在 22 个企业任务和 6 个基础模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6)固定不变的前提下,仅替换编排层 —— 将传统的生产级智能体循环替换为 Writer 自家的 Harness。

实验结果显示:每项任务的平均成本降低 41%(0.21 美元→0.12 美元),中位延迟缩短 44%(48 秒→27 秒),Token 消耗量减少 38%(14.2k→8.8k),而任务完成质量基本持平(0.78→0.81,因样本量较小可视为无显著差异)。在性价比方面,每美元成本所能获得的质量提升高达 82%,同时每百万 Token 能完成的任务数从 54.9 跃升至 92.0。

所以,在模型变成「水电煤」之后,harness 才是那个决定你电费账单的空调?换句话说:以前有人说「模型即产品」,现在是「harness即产品」?

既然 harness 如此重要,那之后的账是不是也应该算得更细一些了?

有人指出,我们有必要在现有的 benchmark 中加入「harness 税」这一项。尤其是考虑到一旦工具调用和重试进入 loop,这笔税不是线性增长。

换句话说,未来的 agent 竞赛,上半场比的是「能不能做」,下半场比的将是「做同样的事,谁更省」—— 而省钱的秘密,不在模型,在 harness。

在跑 Agent 的过程中,你有没有过类似的体验?欢迎在评论区讨论。

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:机器之心

相关问答

Q哪个agent框架在对比实验中表现最节省token?

AKimi Code是最节省token的框架,中位数消耗约6.1万token,而Claude Code则消耗约34万token。Kim Code的成本约为0.22美元,Claude Code的成本则达到2美元。

Q实验发现使用不同框架完成相同任务时,token用量最大差距是多少倍?

A实验结果显示,同样一个任务,使用不同框架(harness)跑下来,token用量最多能相差30倍。

Q导致Claude Code框架消耗更多token的主要原因是什么?

A主要原因在于其输入token消耗巨大。Claude的harness在多轮交互中会反复将大量上下文信息(如之前的消息、工具调用、命令输出和文件内容)塞回模型,导致输入token积累过多,而非输出内容更多。

Q根据文章,如果要降低AI agent的运行成本,首要考虑因素是什么?

A首要考虑因素是选择合适的agent框架(harness)。文章指出,harness对成本的影响远大于更换模型,不同框架间的成本差距可达9倍,而模型的能力表现却相近。

Q文章提出了未来的agent竞赛趋势是什么?

A未来的agent竞赛,上半场比的是“能不能做”,下半场比的将是“做同样的事,谁更省”。降低成本的关键不在于模型,而在于高效、节省的编排层框架(harness)。

你可能也喜欢

富达Q3报告:BTC、ETH与SOL持续筑底,本轮加密熊市还要走多远?

富达数字资产发布了2026年第三季度加密市场信号报告。报告指出,当前加密市场整体仍处于熊市筑底阶段。 **市场总览:** * **加权NUPL(净未实现盈亏):** 已降至-0.01,表明市场整体略低于盈亏平衡线。仅比特币(BTC)仍录得未实现盈利,以太坊(ETH)和Solana(SOL)均处于亏损状态,BTC起到了市场稳定器的作用。 * **BTC主导率:** 升至68%,资金仍高度集中于BTC,尚未出现向其他数字资产的轮动迹象。 * **资产表现:** BTC、ETH、SOL过去一年及年初至今价格全线下跌,多项指标接近历史投降区间。现货ETP持续净流出,宏观环境及市场情绪构成拖累。 **比特币(BTC):** * **NUPL(0.09):** 处于“希望-恐惧”区间,情绪谨慎。 * **动能信号:** 负面,下跌形成偏空脉冲。 * **Yardstick(算力市盈率):** 正面,接近历史低位,显示BTC相对于网络能源投入可能被低估。参照历史底部周期(约300天),当前约203天的调整可能已走完三分之二,2026年10月是可观察的时间窗口。 * **相对黄金表现:** 负面,但近期跌势趋缓。 * **算力:** 负面,受价格低迷及AI算力资源竞争影响,算力从高点回落。 **以太坊(ETH):** * **NUPL(-0.43):** 处于“投降”区间,但历史显示较低NUPL往往对应较高长期回报。 * **动能信号:** 负面,上涨动能未恢复。 * **使用指标:** 中性,链上活动随价格下跌有所降温。 * **稳定币转账额:** 正面,持续创历史新高,显示真实使用需求增强。 * **网络费用:** 负面,受扩容影响持续下降。 **Solana(SOL):** * **NUPL(-0.72):** 处于“投降”区间,历史波动大。 * **动能信号:** 负面,但短期波动率已高于中期,需关注企稳可能。 * **使用指标:** 正面,链上交易活动在熊市中仍保持韧性并增长。 * **稳定币转账额:** 正面,长期上升趋势完好。 * **网络费用:** 中性,下降趋势可能接近底部。 **总结:** 报告认为,市场正处于寻找底部的修复过程中。BTC凭借其流动性优势相对抗跌,而ETH和SOL承受更大压力。虽然多项指标显示市场情绪低迷且接近历史投降区域,为长期投资者可能提供了有吸引力的入场位置,但全面复苏仍需等待更广泛的市场风险偏好恢复和基本面改善。

marsbit1小时前

富达Q3报告:BTC、ETH与SOL持续筑底,本轮加密熊市还要走多远?

marsbit1小时前

HIVE首席执行官:用于AI的GPU每小时收入比挖矿业务高10倍

加拿大上市公司HIVE首席执行官近期指出,人工智能(AI)计算业务的经济效益已远超比特币挖矿。据其透露,公司部署在曼尼托巴省贝尔加拿大AI基础设施中的504块NVIDIA B200 GPU集群,每小时每GPU收入约2.90美元,而比特币挖矿设备每小时仅产生约0.12美元,前者收益是后者的20倍以上。 基于此,HIVE将下半年战略重点转向更高收益的AI基础设施投资,同时维持其比特币挖矿业务。2026财年,公司比特币平均算力达22.2 EH/s,同比增长290%,占全网算力约3%,共开采2,885枚BTC。全年总收入达2.978亿美元,其中比特币挖矿收入增长164%,而专注于AI与高性能计算(HPC)的BUZZ HPC部门收入为1950万美元,同比增长94%。 HIVE的转型始于三年前对NVIDIA芯片的7000万美元投资,这使其在AI计算需求激增时占据了先机。公司近期获得了Chardan Capital的“买入”评级及7.50美元目标价,并与贝尔及AI初创公司Cohere签署了价值约2.2亿美元的GPU云服务协议,同时通过债券融资7500万美元用于进一步发展AI基础设施。 其最雄心勃勃的项目是多伦多地区在建的320兆瓦AI数据中心,预计2027年下半年全面运营后可容纳超10万块GPU,实现约3.6亿美元的年经常性收入。HIVE并非孤例,竞争对手如MARA、Hut 8和Terawulf也纷纷将有限电力资源转向利润更高的AI与HPC合约,这反映了在比特币挖矿利润缩减的背景下,上市矿企的普遍战略转移。 HIVE的近期目标是在本财年末将AI与HPC业务年收入提升至当前水平的十倍,这很大程度上取决于多伦多数据中心及后续GPU云服务合约能否按时推进。

cryptonews.ru2小时前

HIVE首席执行官:用于AI的GPU每小时收入比挖矿业务高10倍

cryptonews.ru2小时前

交易

现货
活动图片