都标5美元,账单差三成,OpenAI高管:token从来没法直接比价

marsbit发布于2026-08-19更新于2026-08-19

文章摘要

这篇文章讨论了AI模型API定价中的一个关键误区:不同模型间单token价格的直接比较并不准确。OpenAI高管指出,token是模型“切分”文本的单位,但各家的“刀法”(分词器)不同,导致同一段文字被切出的token数量差异巨大。例如,同样标价每百万token 5美元,GPT-5.6 Sol将一段文字切为766个token,而Claude Opus 5则切出1170个,实际输入费用相差约三成。 文章以披萨比喻:两家店披萨总价相同,但一家切8块,另一家切16块,每块单价不同,总块数决定了最终花费。同理,token数量直接影响账单,而分词效率受模型训练语料影响,对代码、数字等内容的处理差异可能更大。 除了分词差异,实际成本还受多个因素影响: 1. **缓存机制**:如GPT-5.6 Sol的缓存输入价极低,能显著降低重复内容的成本。 2. **输出定价**:输出token的价格往往高于输入,可能抵消输入端的节省。 3. **长上下文加价**:例如,当输入超过27.2万token时,GPT-5.6 Sol会对整次请求采用更高倍率计费。 4. **上下文窗口设置**:用户可手动调整上下文窗口大小,但更大的窗口可能导致历史记录更长、处理负担更重,更容易触发加价门槛。 文章强调,即使是同一厂商的新旧模型(如Claude 4.7前后),分词器不同也会导致token计数变化约30%,因此跨模型或跨厂商的简单比价意义有限。 最后,作者提出更合理的成本衡量标准应是“每次成功结果的成本”,建议开发者用自身实际任务进行端到端测试,综合评估分词效率、推理质量、输出长度和返工率等因素,才能真正判断哪个模型方案更经济。核心结论是:关注完成任务的总花费,而非单纯的单token单价。

同一段文字,扔给两个模型,一个切成766个token,另一个切成1170个。

甩出这组数字的,是OpenAI Codex负责人Tibo。

他的原话是:一个OpenAI的token,并不等于另一个模型的token。更低的单token价格,并不一定意味着更低的账单。

所有人都在用「每百万token多少美元」比价,好像token是个像克、像千瓦时那样的标准单位,但它不是。

为了让人更容易看懂,他还讲了个披萨的故事。

两张一模一样的披萨。

第一家切8块,每块2美元。第二家切16块,每块1.25美元。第二家招牌上写着更便宜,可整张吃下来要20美元,第一家只要16美元。

他补了一句:你的胃并不关心你刚才吃了几块。

每片更便宜,整张反而更贵。切法不同,单价就失去了可比性。

token是模型计费的最小单位,你可以把它理解成是模型切文字的「刀法」。

同一段话,刀法不一样,切出来的块数就不一样。切出多少块,按多少块收钱。块数越多,账单就越贵。

这次对照覆盖英文、技术文本、多语言和数字内容。

GPT-5.6 Sol的分词器用掉766个token,Claude Opus 5的估算结果是1170个。

同样一段文字,GPT-5.6 Sol的刀法少切出34.5%。

而两家的输入价,都是每百万token5美元。

单价一模一样,块数少了三成,输入费用也跟着少了三成。

麻烦也在这儿。

如果连「一个token有多大」这件事两家都对不齐,那所有人天天转来转去的那张API价格对比表,到底还算不算数?

同一段文字,为何数出两个数?

这是因为token这个单位,压根就没有统一的计量单位。

每家厂商自己训练分词器,自己决定把文本切成多大的碎片。

常见词,分词器整个吞下,生僻词,一个词会被拆成三四块。

拿英文举例最直观。the、and、is这种词天天出现,分词器给它们各留了一个专属编号,一个词就是一个token。

换成unbelievable这种长词,得拆成un、believ、able几块,一个词就占了三个token。

道理很简单:分词器是从训练语料里统计出来的,什么组合出现得频繁,什么组合就单独占一个位置。剩下的,只能用碎块拼。

所以「一段话有多少个token」,本质上是在问「这段话里的东西,在这家的语料里常不常见」。

而英文散文,恰恰是所有内容里差异最小的那一类。代码、JSON、长串数字,两家切出来的结果只会差得更远。

连自家的新旧模型,计数都不能通用

这并非某一家的问题。

Anthropic自家文档写得很明确:token计数是估算值,实际创建消息时用掉的输入token数量可能有小幅出入。

还给出了一个具体的数字。

Claude 4.7及之后的模型换了新分词器,同样的输入文本,产生的token数量比早期模型大约多30%,具体增幅取决于内容和工作负载形态。

Anthropic官方文档:Claude 4.7及之后的模型换用新分词器,同样的文本token数大约多出三成,别复用旧模型量出来的计数。

同一家公司,同一段文字,换代之后多出三成。

所以官方给出的建议是,想知道自己的工作负载差多少,就把同一个请求按两个模型各数一遍,比对返回的input_tokens。

别拿早期模型上量出来的数字估算成本。

自家两代模型之间,计数都不能复用。跨厂商拿「每百万token单价」直接对比,就更谈不上标准化了。

同样5美元,账单差在四处

相同的单价,同样的输入,账单到底差在哪儿?

第一处,刚才说的分词效率。同样一段文本,切出的token数不同,乘上同样的单价,付出去的钱自然不同。

第二处,缓存。

GPT-5.6 Sol的缓存输入价是0.50美元每百万token,只有标准输入价的十分之一。重复前缀多的工作负载,这一项就能把整个账单结构改写。

第三处,输出。

GPT-5.6 Sol输出30美元/百万token,Claude Opus 5是25美元起。

而在真实的智能体工作流里,输出token的权重往往比输入更狠。

也就是说,前面那省下的34.5%,很可能在这里被吐回去。

第四处,最容易被忽略,它就写在OpenAI自己的模型页上。GPT-5.6 Sol的输入超过272K token时,整次请求的输入按2倍计价,输出按1.5倍计价。

GPT-5.6 Sol官方模型页:输入5美元、缓存输入0.50美元、输出30美元,下面那行小字写着超过272K的加价规则。

不是超出的那部分加价,是整次请求适用更高倍率。

同一段代码,你在27万token的上下文里问它,和在28万token的上下文里问它,单价就换了一档。

这条限制来自官方自己的定价页,上下文越长,注意力和显存的开销涨得越快,长窗口从来不是免费的。

百万窗口开了,钱是慢慢流出去的

Tibo随后贴了第二条,教大家怎么在Codex里手动把上下文窗口开满。

打开~/.codex/config.toml,在所有section标题之前加三行:

model = "gpt-5.6-sol"

model_context_window = 1000000

model_auto_compact_token_limit = 900000

第一行选模型,第二行把上下文预算拉到100万token,第三行让自动压缩在90万token附近触发,留出一点余量。

存盘,重启客户端,开一个新会话,配置才生效。

不想动默认值的,也可以只在单次CLI会话里临时覆盖:

codex -m gpt-5.6-sol

-c model_context_window=1000000

-c model_auto_compact_token_limit=900000

这两个键在Codex官方配置参考里都能查到,作用和他写的一致。

model_context_window,当前模型可用的上下文窗口token数。

model_auto_compact_token_limit,触发自动历史压缩的阈值。

但文档只定义键的含义,并没有把「100万/90万」这组数值列成通用推荐值。

Tibo自己在帖子末尾也补了一句:默认值是他们仔细调过的。

那为什么这么多人想手动改?

GitHub上有一份用户实测报告说明了原因。

openai/codex仓库里的这份实测报告:Codex目录把窗口卡在372K,有效353.4K,而模型规格写的是1.05M

在特定版本的Codex客户端和ChatGPT Pro账户下,模型目录里给gpt-5.6-sol标注的窗口是372K,按95%折算,实际可用353.4K。而官方模型页标称的是1.05M。

买的是百万窗口,用起来只剩三分之一。

这份报告有明确的版本和账户限定,不能当成所有用户的现状,Tibo的配置帖发布时间还更晚。

还要澄清一件事:把配置改到100万,不会立刻产生100万token的费用。计费的从来是实际处理量。

可是压缩阈值一路推到90万,意味着一场长会话会背着越来越长的历史往前走,每一轮请求都要把这段历史重新过一遍。

窗口越大、压缩越晚,请求就越可能撞上刚才那个272K的门槛。

短对话里,分词器那点差异是小数点后面的事。会话拉到几十万token,历史记录反复带着走,再乘上一档更高的倍率,差异的小数点就变成了整数位。

钱不是一下子花掉的,是一轮一轮涨上去的。

下一个单位,是「每次成功」

Tibo那条帖子里还有一句话,被数字盖过去了:真正重要的是每次成功结果的成本(price per successful outcome)。

他还给了办法。基准测试可以当起点,但真要知道贵不贵,得拿自己的活儿去跑一遍。

这句话把比价的锚点换了。从「每百万token多少钱」,换到「跑完同一个任务总共花了多少钱」。

想知道两家在你手上到底谁更便宜,自己测一遍就行。

拿同一段原始文本、同样的语言配比、同样的工具定义,分别调用两家官方的计数接口拿到真实token数,再算上缓存命中、输出长度、推理长度和长上下文倍率,最后比谁把这件事干完花得更少。

分词效率只是这条链上的第一环。一个分词更省的模型,如果推理啰嗦、返工次数多,账单照样能反超回去。

以后该问的不是一百万token多少钱,是修好这个bug要多少钱。

参考资料:

https://x.com/thsottiaux/status/2089082893804896524?s=20

https://x.com/thsottiaux/status/2088866513008873560?s=20 https://github.com/openai/codex/issues/31860

本文来自微信公众号“新智元”,作者:ASI启示录

热门币种推荐

相关问答

Q为什么OpenAI高管说token之间不能直接比价?

A因为token是各家公司根据自己训练语料和分词器决定的文本切分单位,不同模型对同一段文本切出的token数量不同。即使每百万token单价相同,由于实际切出的token数量(即‘刀法’)有差异,最终账单金额也会有显著差别。

Q根据文章,同一段文字在不同模型中切出的token数量差异有多大?

A文章中给出的例子显示,同一段文字,GPT-5.6 Sol的分词器切出766个token,而Claude Opus 5切出1170个token。GPT-5.6 Sol比Claude Opus 5少切了约34.5%的token。

Q除了分词效率,导致不同模型账单差异的因素还有哪些?

A导致账单差异的因素主要有四个:1. 分词效率(切出的token数量不同);2. 缓存价格(如GPT-5.6 Sol有更便宜的缓存输入);3. 输出价格(不同模型输出单价不同);4. 长上下文加价规则(如GPT-5.6 Sol在输入超过272K token后,整次请求按更高倍率计价)。

Q为什么文章说跨厂商比较‘每百万token单价’没有标准化意义?

A因为token的大小(即一段文字被切分成多少块)是由各家厂商的分词器独立决定的,没有统一的计量标准。甚至同一家公司不同代际的模型(如Claude早期模型与4.7之后的新模型),对同一段文字的token计数都可能相差约30%。因此,单纯比较单价无法反映实际使用成本。

Q根据OpenAI高管的观点,衡量模型成本的更有效指标是什么?

A更有效的指标是‘每次成功结果的成本’(price per successful outcome)。这意味着应该比较完成同一个具体任务(如修好一个bug、生成一份报告)的总花费,这综合了分词效率、输出长度、推理准确性、是否需要返工等所有实际成本因素,而不是只看每百万token的单价。

你可能也喜欢

“AI焚书”,其实是个误解

近期关于“AI焚书”的争议愈演愈烈。媒体报道称,AI公司(如Anthropic)通过亚马逊等项目,大规模采购二手纸质书,进行破坏性扫描(切书脊、高速扫描)以数字化内容,之后处理掉原书,引发了公众对“AI吞噬人类文明”的强烈担忧。 然而,深入分析会发现,事实与情绪之间存在错位。首先,AI公司扫描并销毁的书籍数量(如Anthropic一年数百万本)在整个庞大的二手书市场(仅一家大型书商年销量就数千万本)中占比有限,远未到“吃干抹净”的程度。其次,实体书的销毁不等于知识的消失,其内容被数字化后用于AI训练,反而以新形式留存和活化,这与历史上的“焚书”目的相反。 争议焦点在于AI公司也采购了一些稀有或绝版书。但需厘清:稀缺不等于珍贵,许多绝版书文化价值有限;且书籍作为流通商品,买家(无论是个人还是公司)在合法购得后有权处置。问题在于,若某书真的极具公共文化价值,为何博物馆、图书馆等公共机构未在流通市场抢先保护?将保护责任完全寄望于商业公司的道德并不可靠。 真正的风险在于,AI公司集中采购可能消耗某些本就脆弱的稀缺书目。解决方案应从公共规则层面入手,例如建立珍稀书保护名录、赋予公共机构优先购买权、要求平台对大额采购预警,或强制大规模扫描者贡献书目数据等,而非仅依赖企业自律。 公众对“AI焚书”的强烈反应,深层源于对AI快速发展的复杂矛盾心理:人们越来越依赖AI工具,同时也对其威胁就业、掌控知识源头感到焦虑与愤怒。“切书”这一视觉冲击强的行为,恰好成为汇聚版权忧虑、职业危机感及对科技巨头不信任情绪的符号。因此,当前的舆论浪潮很大程度上是象征意义的宣泄,实际的文化损失可能被高估了。

marsbit7分钟前

“AI焚书”,其实是个误解

marsbit7分钟前

交易

现货

热门文章

如何购买BILL

欢迎来到HTX.com!我们已经让购买Billions Network(BILL)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Billions Network(BILL)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Billions Network(BILL)购买完您的Billions Network(BILL)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Billions Network(BILL)在HTX的现货市场轻松交易Billions Network(BILL)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.1k人学过发布于 2026.05.07更新于 2026.06.02

如何购买BILL

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对BILL(BILL)币价的意见。

活动图片