只降价20%,账单却少八成,GPT-5.6杀入Claude地盘重算编程账

marsbit發佈於 2026-08-28更新於 2026-08-28

文章摘要

8月24日,OpenAI与AWS联合测试显示,GPT-5.6 Terra在AWS的软件开发平台Kiro上完成任务成本降低了约82%,远超模型本身20%的官方降价幅度。这主要得益于Kiro的“spec-driven”工作流优化,它将模糊任务拆解为清晰需求文档与技术设计,减少了模型在规划、试错和返工中的无效token消耗。 测试基于Terminal-Bench 2.1,评估的是“智能体+模型”组合的整体效率。对比数据显示,相同准确率下,不同框架与模型组合的成本差异显著。例如,Claude Code与Fable 5组合成本为552.67美元,而Codex与GPT-5.5组合成本高达2059.19美元。 今年7月,GPT-5.6系列模型(Sol、Terra、Luna)入驻Kiro,标志着OpenAI首次进入这一由Anthropic主导的开发平台。模型采取渐进式开放,且推理过程为隐藏思维链。价格上,Kiro随后跟进OpenAI调价,Luna计费系数大幅下调至0.1倍,Terra降至1.0倍。 此次成本大幅降低凸显了AI开发的新趋势:评价标准正从单纯的模型性能转向“完成任务的综合成本”。智能体框架、编排策略与模型分工的协同优化,成为降低实际应用开销的关键。对开发者而言,选择模型时更需要关注端到端的执行效率与经济性。

同一个模型,官方价格只降了20%,你的账单却少了八成。

8月24日,OpenAI公布了一项与AWS一起做的测试结果:

在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro里完成一个成功任务的成本,降低了约82%。

Kiro是AWS的软件开发智能体平台,覆盖IDE、CLI和Web。

GPT-5.6家族的Sol、Terra、Luna三兄弟,已在里面跑了一个多月。

这82%,并非官方降价。

Terra最近一次调价是在7月30日,幅度20%。

7月30日OpenAI调价公告,Terra降20%。

单价只降20%,账单却能砍掉八成。

中间差的那六十个百分点是从哪儿省出来的,才是真正值得我们关注的。

GPT-5.6登陆Kiro是今年7月的事儿。

先是13日,AWS宣布GPT-5.6 Sol、Terra、Luna在Amazon Bedrock正式可用。

紧接第二天,Kiro发博客宣布三款模型上线IDE、CLI和Web。

这是OpenAI模型第一次进Kiro,刚好赶上Kiro公开预览一周年。

先把模型摆上货架,再拉去干活,一个多月后,OpenAI回来交作业:

两家联手把Kiro环境和OpenAI模型一起调了一遍,Terra完成一个成功任务的成本,降了约82%。

省下的

是走弯路的钱

7月30日那次调价,Terra降了20%,可到了Kiro的测试里,单任务成本降了82%。

那多省下的六成,是从哪儿来的?

方向就这么几个:

模型吐的token更少了,工具来回调的次数更少了,失败之后的重试和绕远路更少了。

所以省下的这一大块,并非每次调用的钱,而是那些原本会白花的调用的钱。

道理很简单:一个AI智能体把任务做砸一次,账单照记。它中途选错路径、跑偏三轮再回头,这些token也照收。

真实开发里,钱往往就是这么漏掉的。

OpenAI在官方博客中也点过同一套逻辑,效率来自三层:

发起请求、组织上下文的智能体框架,中间调度请求的编排系统,最后才是GPU上跑的模型本身。

OpenAI拆解GPT-5.6的效率来源:请求从智能体框架出发,经编排系统调度,最后到GPU跑模型,每一层都在省。

省钱还能省到模型分工上。

OpenAI还举过一个用法:编码工作流可以先用Sol把问题想清楚、把计划定下来,再换Luna去实施那些已经定义清楚的改动、写测试、跑评估。

同一条流水线,不同环节配不同档位的智能。

模型只占账单一半

换个框架就换个价

Terminal-Bench 2.1这套题,不是让模型单独答卷。

它把模型丢进一个终端环境,给一个模糊目标,让它自己规划路径、调工具、写脚本、处理报错、反复迭代。

所以跑出来的成绩,是「智能体+模型」这个组合的成绩。

Terminal-Bench 2.1公开榜单,准确率右边多了一项成本。(图源:Terminal-Bench)

榜单里的四行数字最能说明问题:

Claude Code配Fable 5,83.8%,552.67美元;

Codex配GPT-5.5,83.1%,2059.19美元;

Codex配GPT-5.6 Terra,78.4%,421.15美元;

Codex配GPT-5.6 Luna,75.7%,241.45美元。

前两行分数只差0.7个百分点,账单却差了将近4倍。

同一个模型,装进不同的框架,配不同的上下文组织和工具策略,跑出来也根本不是一个价。

按Kiro官方给的数据,Terra在Coding Agent Index上拿77.4分,只比Claude Fable 5的77.2高一点。

它的卖点不在分数,在于这个分数所对应的价钱。

Kiro那套spec-driven的发力点也在这里,核心玩法就一句:不许上来就写代码。

它先把用户那句含糊的目标,拆成正经的需求文档、技术设计和可执行任务清单,再交给模型。

这样,模型到手的不再是一句含糊不清的话,而是一份理清楚的活儿。

熟悉Agent的人会立刻反应过来,这一步省的正是最昂贵的那部分开销。

模型跑偏、返工、推倒重来,烧掉的token往往比正经干活还多。

Kiro还在流程里留了两道闸栏:代码真正修改前,先停下来让人过一眼;活干完之后,再自动跑一轮测试验证对不对。

这两道闸拦下的每一次返工,都能省下真金白银。

Claude在亚马逊的地盘

GPT分走了一半

一年前,Kiro还只是个spec-driven的IDE,模型选择器是Anthropic的主场。

一年后,AWS在自家开发智能体平台上,一口气摆进三档OpenAI模型。

Sol、Terra、Luna跟Claude并排列进同一个下拉菜单,这画面搁一年前很难想象。

虽然GPT-5.6这次是「全家入驻」,但并未「全面开放」。

三款模型是渐进式、实验性开放,面向Pro、Pro+、Pro Max和Power用户,区域只有两个,美国的弗吉尼亚北部和欧洲的法兰克福,支持跨区域推理。

还有一条挺多人不适应的:这批模型在Kiro里走的是隐藏思维链,你看不到它的推理步骤,只看得到最终结果。

习惯了盯着Agent一步步推理的人,会觉得像把活扔进了一个不透明的盒子。

官方的说法是,这是预期行为,不影响输出质量。

三档模型在Kiro里明码标价。

7月14日刚上线那会儿,同样的任务,Sol扣2.4倍,Terra扣1.2倍,Luna扣0.6倍。

7月30日OpenAI那轮降价落地,第二天Kiro跟进:Luna从0.6倍一路砍到0.1倍,Terra从1.2倍降到1.0倍,只有Sol未动。

AWS的态度摆在了明面上:一个开发平台,不能只绑一家模型。

同一个选择器里,两家前沿模型开始互相压价。

模型的评价标准也跟着变了:分数高不再默认能赢,花钱少同样能赢。

对开发者来说,选模型以前问的是「这个模型多少钱一百万token」,现在得问「让它把这件事做完,我到底要花多少」。

参考资料:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

本文来自微信公众号“新智元”(ID:AI_era),作者:ASI启示录,编辑:元宇

熱門幣種推薦

相關問答

Q根据文章,GPT-5.6 Terra模型的官方价格在7月30日降低了多少?最终在Kiro平台上完成一个任务的平均成本降低了多少?

AGPT-5.6 Terra模型在7月30日的官方价格降低了20%。在AWS的Kiro平台上,通过模型与平台的协同优化,完成一个成功任务的成本降低了约82%。

Q文章中提到账单成本大幅降低(82%)的关键因素是什么?请简述这些因素。

A账单成本大幅降低的关键因素并非仅仅来自模型单价的下降(20%),更多是来自效率优化。这主要包括:模型输出的token更少,工具调用次数减少,任务失败后的重试和绕路减少。本质上,节省的是那些因任务失败、路径选择错误而“白花”的token费用。OpenAI指出效率来自三层优化:智能体框架、请求编排系统和模型本身。

Q在Terminal-Bench 2.1的榜单对比中,为什么Claude Code配Fable 5与Codex配GPT-5.5的准确率相近,但成本相差近4倍?

A因为Terminal-Bench 2.1测试的是“智能体+模型”组合的整体表现。虽然两者最终准确率相近,但不同的智能体框架(如Fable 5与Codex)在组织上下文、调度工具、规划任务路径等方面的策略和效率不同。Codex配GPT-5.5的组合在完成任务过程中可能消耗了更多的token(例如,更多次数的无效尝试、返工),导致总成本远高于Claude Code配Fable 5的组合。

QAWS的Kiro平台采用了什么核心方法来降低AI编程智能体的成本?

AKiro平台采用了“spec-driven”(规范驱动)的核心方法。它不直接让模型根据模糊指令写代码,而是先将用户模糊的目标拆解成详细的需求文档、技术设计和可执行的任务清单,再交给模型执行。这样模型接收到的是清晰、结构化的任务,大幅减少了因理解偏差而导致的跑偏、返工和token浪费。平台还设置了人工确认和自动化测试两道“闸栏”,进一步拦截错误,节省成本。

QGPT-5.6系列模型(Sol, Terra, Luna)在Kiro平台上线后,对开发者选择模型的标准产生了什么影响?

AGPT-5.6系列模型上线Kiro并与Claude模型同台竞争后,改变了开发者选择模型的标准。过去开发者主要关注“每百万token的价格”,而现在更需要关注“完成特定任务的总成本”。模型的竞争维度从单纯的“能力分数”扩展到了“成本效率”,即花更少的钱把事情办成同样变得具有竞争力。这促使开发者在评估模型时,必须综合考虑其在实际工作流中的整体效率和花费。

你可能也喜歡

知名经济学家猛烈抨击美联储近期政策:“他们在朝错误的方向前进”

知名经济学家詹姆斯·E·托恩严厉批评美联储针对通胀的强硬货币政策。他认为,当前物价压力主要由能源成本、住房短缺、生产缩减等供给侧限制因素推动,而非单纯由需求过热引起。托恩指出,美联储主席凯文·沃什及华尔街圈子错误地将供给驱动的通胀视为经典的、由过度需求引起的经济过热问题。 托恩强调,全职就业数据下降可能反映了经济结构性转型,而非短暂异常,这表明劳动力市场正在适应变化的财政政策与产业条件,而非经济过热。同时,住房市场作为对利率最敏感的领域,正直接承受紧缩政策的压力,而非制造通胀。 他认为,近期美国经济增长主要源于前政府旨在刺激供给的经济政策以及长期投资周期(如对人工智能、数据中心、电力生产和基础设施的投资),而非信贷驱动的普遍过热。在此情况下进一步加息,不仅难以抑制通胀,反而可能削弱经济生产潜力,阻碍生产能力扩张。 托恩补充道,根据经典经济理论,石油价格冲击或关税导致的供给侧冲击通常只会造成一次性价格水平上升,而非持续性的自我强化通胀进程。他认为没有证据表明经济中的中性实际利率(r*)在短期内大幅上升。 托恩的核心质疑是:在面临全职就业萎缩和住房市场持续承压的情况下,美联储进一步收紧货币政策是否明智。他警告称,新的加息行动可能并非审慎控通胀,而是源于对经济形势的误判,错误地将面临供给限制和结构性转型的经济当作过热来处理,从而演变为对需求的刻意压制。

cryptonews.ru2 小時前

知名经济学家猛烈抨击美联储近期政策:“他们在朝错误的方向前进”

cryptonews.ru2 小時前

切勿轻信,务必核实:AI恶意链接揭示了加密货币行业工作者的可怕现实

生成式人工智能技术日益普及,加密货币和区块链行业从业者经常在工作中使用此类工具。然而,这个群体也成为黑客的重点目标,其难以撤销的敏感信息面临被盗风险。近日,Refi Hub联合创始人Numa Lunah称自己遭遇了“黑客攻击”。 他描述,攻击始于Claude聊天界面推荐的一个“录音转文字应用”下载链接。该链接指向一个伪造网站,其中包含恶意软件。他执行命令后,恶意软件立即运行并试图窃取所有信息。尽管他及时清理了笔记本电脑并重装系统,未导致敏感信息泄露,但在后续从备份恢复数据时,他发现一个名为SKILL.md的Claude代码文件已被感染。该文件外观与他的代码风格指南无异,内部却隐藏了指令,会在每次AI加载该文件时重新下载恶意软件并窃取凭证。 这不是大型语言模型首次提供恶意回复。此前,微软专家已警告,攻击手段已从简单的搜索引擎优化投毒升级为“污染”LLM的回复。此类攻击可来自Gemini、Claude、Copilot、ChatGPT等模型,形式包括:通过上下文窗口传播的恶意文件、聊天机器人推荐的黑客可控下载链接、假冒AI品牌的安装程序,以及受感染的源代码和智能体技能。 对加密货币从业者而言,安全隐患尤为严峻,因为其设备上可能存有无法撤销访问权限的敏感数据,例如助记词、私钥文件、交易所提现API密钥、部署密钥、Lightning网络凭据、硬件钱包相关数据以及中心化交易所的会话Cookie等。 分析指出,最危险的漏洞可能是人类的信任与惰性。当前需要一场安全文化的根本转变:从业者必须对自动化工具保持全面警惕,将AI的每个建议都视为潜在威胁。这并非过度谨慎,而是生存必需。此事件中,Refi Hub联合创始人得以幸免,正是因为他坚持在让AI接触前,仔细检查了每一个设置文件、钩子和配置。遗憾的是,多数AI用户很可能不会核实AI提供信息的真实性,而是出于难以解释的原因盲目信任。

cryptonews.ru2 小時前

切勿轻信,务必核实:AI恶意链接揭示了加密货币行业工作者的可怕现实

cryptonews.ru2 小時前

Grayscale 点名三种加密货币:可能从美国国债增长中受益

灰度公司(Grayscale)研究主管扎克·潘德尔于8月26日发布分析指出,美国国债的快速增长可能推高对比特币(BTC)、以太坊(ETH)和Zcash(ZEC)的需求。他认为,失控的国债增长削弱了法币信任,促使投资者转向黄金和某些加密货币等替代性储值资产。在数字资产领域,这种所谓的“贬值交易”将主要使比特币、以太坊和Zcash受益。 潘德尔分析称,比特币因其2100万枚的硬上限和去中心化发行,在稀缺性上最具说服力;以太坊是去中心化结算网络;Zcash则结合了类似比特币的架构与增强的隐私功能。 文章提及,美国财政部已于8月19日宣布计划扩大长期债券回购规模,以应对债市压力。然而,这些操作旨在改善市场流动性,并未解决导致持续借贷的结构性赤字问题。美国联邦债务总额已于8月18日首次超过40万亿美元。 持续的预算赤字表明债务可能继续攀升。国会预算办公室曾预测,联邦赤字将从2026财年的1.9万亿美元增至2036年的3.1万亿美元。利率上升可能加剧财政压力,同时私人部门为AI基础设施融资的借贷也与国债竞争资本,可能推高利率和联邦融资成本,加剧投资者对长期预算稳定的担忧。财政部将于11月4日提供更多回购细节,而预算办公室预测公众持有的债务占GDP比例将从2026年的101%升至2036年的120%。

cryptonews.ru2 小時前

Grayscale 点名三种加密货币:可能从美国国债增长中受益

cryptonews.ru2 小時前

交易

現貨

熱門文章

如何購買BILL

歡迎來到HTX.com!在這裡,購買Billions Network (BILL)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買Billions Network (BILL)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的Billions Network (BILL)購買Billions Network (BILL)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易Billions Network (BILL)在HTX的現貨市場輕鬆交易Billions Network (BILL)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

814 人學過發佈於 2026.05.07更新於 2026.06.02

如何購買BILL

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 BILL (BILL)幣價的意見。

活动图片