Chỉ giảm 20%, hóa đơn lại ít hơn 80%, GPT-5.6 tiến vào lãnh địa Claude tính lại bài toán lập trình

marsbit發佈於 2026-08-28更新於 2026-08-28

文章摘要

Cùng một mô hình, giá chính thức chỉ giảm 20%, nhưng hóa đơn của bạn lại giảm tới 80%. OpenAI và AWS công bố kết quả thử nghiệm trên Terminal-Bench 2.1: GPT-5.6 Terra trong nền tảng phát triển phần mềm Kiro đã giảm chi phí hoàn thành một nhiệm vụ thành công khoảng 82%. Sự khác biệt 60% này đến từ đâu? Không chỉ từ việc giảm giá mô hình (Terra giảm 20% vào 30/7), mà chủ yếu từ việc tối ưu hóa hiệu quả trong môi trường Kiro. Khi một AI agent thực hiện sai, thử lại hoặc đi đường vòng, những token đó vẫn bị tính phí. Kiro áp dụng phương pháp "spec-driven", biến yêu cầu mơ hồ thành tài liệu kỹ thuật rõ ràng trước khi viết code, đồng thời thêm các bước kiểm tra và xác minh, từ đó giảm đáng kể số lần thử sai và token lãng phí. Trên bảng xếp hạng Terminal-Bench 2.1, Claude Code với Fable 5 đạt 83,8%, chi phí 552,67 USD; trong khi Codex với GPT-5.5 đạt 83,1% nhưng chi phí lên tới 2059,19 USD. Điều này cho thấy cùng một mô hình, với framework và chiến lược công cụ khác nhau, có thể cho ra chi phí khác biệt lớn. GPT-5.6 Terra đạt điểm tương đương Claude Fable 5 nhưng với mức giá cạnh tranh hơn. AWS đã đưa ba mô hình GPT-5.6 (Sol, Terra, Luna) vào Kiro bên cạnh Claude, đánh dấu sự cạnh tranh trực tiếp. Giá trên Kiro được điều chỉnh sau đợt giảm giá của OpenAI, với Luna giảm mạnh từ hệ số 0,6 xuống 0,1. Tiêu chí lựa chọn mô hình giờ không chỉ là "điểm số cao" mà còn là "hoàn thành công việc với chi phí thấp nhất".

Cùng một mô hình, giá chính thức chỉ giảm 20%, hóa đơn của bạn lại giảm đến 80%.

Ngày 24 tháng 8, OpenAI đã công bố kết quả thử nghiệm thực hiện cùng với AWS:

Trên Terminal-Bench 2.1, chi phí để GPT-5.6 Terra hoàn thành một nhiệm vụ thành công trong Kiro, đã giảm khoảng 82%.

Kiro là nền tảng trí tuệ nhân tạo phát triển phần mềm của AWS, bao phủ IDE, CLI và Web.

Ba anh em Sol, Terra, Luna trong gia đình GPT-5.6 đã chạy trong đó hơn một tháng.

82% này, không phải là mức giảm giá chính thức.

Lần điều chỉnh giá gần đây nhất của Terra là vào ngày 30 tháng 7, với mức 20%.

Thông báo điều chỉnh giá của OpenAI ngày 30/7, Terra giảm 20%.

Đơn giá chỉ giảm 20%, nhưng hóa đơn lại có thể cắt giảm 80%.

Sáu mươi phần trăm chênh lệch ở giữa được tiết kiệm từ đâu, mới là điều thực sự đáng để chúng ta chú ý.

Việc GPT-5.6 đổ bộ lên Kiro là chuyện của tháng 7 năm nay.

Đầu tiên là ngày 13, AWS thông báo GPT-5.6 Sol, Terra, Luna đã chính thức khả dụng trên Amazon Bedrock.

Tiếp ngay ngày hôm sau, Kiro đăng blog thông báo ba mô hình đã lên sàn trên IDE, CLI và Web.

Đây là lần đầu tiên mô hình của OpenAI vào Kiro, vừa kịp dịp Kiro công khai xem trước được một năm.

Đưa mô hình lên kệ trước, rồi kéo đi làm việc, hơn một tháng sau, OpenAI quay lại nộp bài:

Hai bên hợp tác điều chỉnh một lượt môi trường Kiro và mô hình OpenAI, chi phí để Terra hoàn thành một nhiệm vụ thành công, đã giảm khoảng 82%.

Tiền tiết kiệm được

Là tiền đi đường vòng

Lần điều chỉnh giá ngày 30 tháng 7, Terra giảm 20%, nhưng trong thử nghiệm của Kiro, chi phí đơn nhiệm vụ lại giảm 82%.

Sáu phần mười tiết kiệm thêm đó, là từ đâu ra?

Hướng chỉ có mấy cái này:

Mô hình nhả ra ít token hơn, số lần gọi đi gọi lại công cụ ít hơn, số lần thử lại và đi đường vòng sau khi thất bại ít hơn.

Vì vậy, khoản tiết kiệm lớn này, không phải là tiền cho mỗi lần gọi, mà là tiền cho những lần gọi đáng lẽ sẽ bị lãng phí.

Đạo lý rất đơn giản: Một AI agent làm hỏng nhiệm vụ một lần, hóa đơn vẫn tính. Nó chọn sai đường giữa chừng, chạy lệch ba vòng rồi quay đầu, những token này cũng tính tiền như thường.

Trong phát triển thực tế, tiền thường rò rỉ theo cách này.

OpenAI trong blog chính thức cũng chỉ ra cùng một logic, hiệu quả đến từ ba tầng:

Khung agent khởi tạo yêu cầu, tổ chức ngữ cảnh, hệ thống điều phối trung gian điều động yêu cầu, cuối cùng mới là chính mô hình chạy trên GPU.

OpenAI phân tích nguồn gốc hiệu quả của GPT-5.6: Yêu cầu xuất phát từ khung agent, được hệ thống điều phối lên lịch, cuối cùng đến GPU chạy mô hình, mỗi tầng đều tiết kiệm.

Tiết kiệm tiền còn có thể tiết kiệm đến phân công mô hình.

OpenAI cũng từng nêu một cách dùng: Quy trình làm việc viết code có thể dùng Sol để suy nghĩ rõ vấn đề, định ra kế hoạch trước, sau đó đổi sang Luna để thực hiện những thay đổi đã được xác định rõ ràng, viết test, chạy đánh giá.

Cùng một dây chuyền, các khâu khác nhau phối hợp trí thông minh ở các phân khúc khác nhau.

Mô hình chỉ chiếm một nửa hóa đơn

Đổi khung là đổi giá

Bộ đề Terminal-Bench 2.1 này, không phải để mô hình làm bài một mình.

Nó ném mô hình vào một môi trường terminal, đưa ra một mục tiêu mơ hồ, để nó tự lên kế hoạch đường đi, gọi công cụ, viết script, xử lý báo lỗi, lặp đi lặp lại.

Vì vậy, điểm số chạy ra, là điểm số của tổ hợp "agent + mô hình".

Bảng xếp hạng công khai Terminal-Bench 2.1, bên phải tỷ lệ chính xác có thêm một mục chi phí. (Nguồn: Terminal-Bench)

Bốn dòng số trong bảng xếp hạng nói rõ vấn đề nhất:

Claude Code với Fable 5, 83.8%, 552.67 USD;

Codex với GPT-5.5, 83.1%, 2059.19 USD;

Codex với GPT-5.6 Terra, 78.4%, 421.15 USD;

Codex với GPT-5.6 Luna, 75.7%, 241.45 USD.

Hai dòng đầu điểm số chỉ chênh 0.7 phần trăm, hóa đơn lại chênh gần 4 lần.

Cùng một mô hình, lắp vào các khung khác nhau, phối hợp chiến lược tổ chức ngữ cảnh và công cụ khác nhau, chạy ra cũng hoàn toàn không phải một mức giá.

Theo dữ liệu chính thức Kiro cung cấp, Terra trên Coding Agent Index đạt 77.4 điểm, chỉ cao hơn một chút so với 77.2 điểm của Claude Fable 5.

Điểm bán hàng của nó không nằm ở điểm số, mà nằm ở mức giá tương ứng với điểm số này.

Điểm phát lực spec-driven của bộ Kiro đó cũng ở đây, cách chơi cốt lõi chỉ một câu: Không được lên là viết code.

Nó trước tiên tách mục tiêu mơ hồ của người dùng thành tài liệu yêu cầu chính thức, thiết kế kỹ thuật và danh sách nhiệm vụ có thể thực thi, rồi mới giao cho mô hình.

Như vậy, thứ mô hình nhận được không còn là một câu nói mập mờ, mà là một mớ việc đã được sắp xếp rõ ràng.

Người quen thuộc với Agent sẽ lập tức phản ứng, bước này tiết kiệm chính là phần chi phí đắt đỏ nhất.

Mô hình chạy lệch, làm lại, đập đi xây lại, số token đốt cháy thường còn nhiều hơn làm việc chính thức.

Kiro còn để lại hai rào chắn trong quy trình: Trước khi mã thực sự được sửa, dừng lại để người xem qua một lượt; sau khi việc hoàn thành, tự động chạy một lượt test để xác minh đúng sai.

Mỗi lần làm lại bị hai rào chắn này ngăn lại, đều có thể tiết kiệm tiền thật.

Claude trong lãnh địa của Amazon

GPT chiếm mất một nửa

Một năm trước, Kiro chỉ là một IDE spec-driven, bộ chọn mô hình là sân nhà của Anthropic.

Một năm sau, AWS trên nền tảng trí tuệ nhân tạo phát triển phần mềm của chính mình, một lúc đưa vào ba phân khúc mô hình của OpenAI.

Sol, Terra, Luna xếp hàng cùng Claude vào cùng một menu thả xuống, cảnh tượng này đặt một năm trước khó mà tưởng tượng.

Mặc dù GPT-5.6 lần này là "cả nhà đóng quân", nhưng không phải "mở cửa toàn diện".

Ba mô hình được mở theo kiểu tiệm tiến, thử nghiệm, hướng đến người dùng Pro, Pro+, Pro Max và Power, khu vực chỉ có hai, Bắc Virginia của Mỹ và Frankfurt của châu Âu, hỗ trợ suy luận xuyên khu vực.

Còn có một điều khá nhiều người không quen: Nhóm mô hình này trong Kiro chạy theo chuỗi suy nghĩ ẩn, bạn không nhìn thấy các bước lập luận của nó, chỉ nhìn thấy kết quả cuối cùng.

Người quen theo dõi Agent lập luận từng bước, sẽ cảm thấy như ném việc vào một cái hộp không trong suốt.

Cách nói chính thức là, đây là hành vi dự kiến, không ảnh hưởng chất lượng đầu ra.

Ba phân khúc mô hình trong Kiro được niêm yết giá rõ ràng.

Ngày 14 tháng 7 vừa lên sàn lúc đó, cùng một nhiệm vụ, Sol trừ 2.4 lần, Terra trừ 1.2 lần, Luna trừ 0.6 lần.

Ngày 30 tháng 7 đợt giảm giá của OpenAI hạ cánh, ngày hôm sau Kiro theo kịp: Luna từ 0.6 lần cắt thẳng xuống 0.1 lần, Terra từ 1.2 lần giảm xuống 1.0 lần, chỉ có Sol là không động.

Thái độ của AWS đã đặt rõ trên mặt bàn: Một nền tảng phát triển, không thể chỉ buộc vào một mô hình.

Trong cùng một bộ chọn, hai mô hình tiên phong bắt đầu đè giá lẫn nhau.

Tiêu chuẩn đánh giá mô hình cũng thay đổi theo: Điểm cao không còn mặc định là thắng, tiêu ít tiền cũng có thể thắng.

Đối với nhà phát triển, chọn mô hình trước đây hỏi là "mô hình này bao nhiêu tiền một triệu token", bây giờ phải hỏi "để nó làm xong việc này, rốt cuộc tôi phải trả bao nhiêu".

Tài liệu tham khảo:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Bài viết này từ tài khoản WeChat công chúng "Tân Trí Nguyên" (ID: AI_era), tác giả: ASI Khải Thị Lục, biên tập: Nguyên Vũ

熱門幣種推薦

相關問答

QTại sao cùng một mô hình GPT-5.6 Terra, giá chính thức chỉ giảm 20% nhưng hóa đơn thực tế lại giảm tới 82% khi chạy trong Kiro?

AHóa đơn giảm 82% không chỉ đến từ việc giảm giá mô hình 20% mà chủ yếu là do tối ưu hóa toàn bộ hệ thống. Open AI và AWS đã cùng điều chỉnh môi trường Kiro và cách mô hình hoạt động trong đó, giúp giảm đáng kể số lần gọi công cụ không cần thiết, giảm token thừa và hạn chế thử lại khi thất bại. Điều này tiết kiệm phần chi phí lớn nhất vốn bị lãng phí khi agent đi sai hướng hoặc thực hiện các bước dư thừa.

QTheo bài viết, những yếu tố nào ngoài mô hình đã góp phần giảm chi phí đáng kể trong Kiro?

ABa yếu tố chính góp phần giảm chi phí là: 1) Khung agent (framework) thông minh hơn trong việc tổ chức ngữ cảnh và khởi tạo yêu cầu. 2) Hệ thống điều phối (orchestration system) tối ưu việc lập lịch và quản lý các yêu cầu. 3) Chiến lược sử dụng mô hình, như việc phân công công việc (dùng Sol để lập kế hoạch và Luna để thực thi) giúp sử dụng đúng mô hình phù hợp với từng công đoạn, tránh lãng phí.

QChiến lược 'spec-driven' của Kiro là gì và nó giúp tiết kiệm chi phí như thế nào?

AChiến lược 'spec-driven' của Kiro yêu cầu không viết code ngay lập tức. Thay vào đó, nó phân tích mục tiêu mơ hồ của người dùng thành một tài liệu yêu cầu chi tiết, thiết kế kỹ thuật và danh sách công việc có thể thực thi rõ ràng trước khi giao cho mô hình. Cách này giúp mô hình nhận được đầu vào rõ ràng, giảm đáng kể khả năng hiểu sai, đi chệch hướng, phải làm lại - những nguyên nhân chính đốt token và tăng chi phí. Kiro còn có hai 'cửa kiểm soát': duyệt code trước khi sửa và chạy kiểm thử tự động sau khi hoàn thành để ngăn các lần sửa lỗi tốn kém.

QViệc GPT-5.6 có mặt trên nền tảng Kiro của AWS thể hiện điều gì về thị trường và chiến lược của AWS?

AViệc GPT-5.6 (Sol, Terra, Luna) xuất hiện cùng Claude trong menu lựa chọn mô hình trên Kiro cho thấy AWS không muốn phụ thuộc vào một nhà cung cấp mô hình duy nhất. Họ đang theo đuổi chiến lược đa dạng hóa, tạo ra một thị trường cạnh tranh ngay trên nền tảng của mình. Điều này buộc các nhà cung cấp như OpenAI và Anthropic phải cạnh tranh không chỉ về hiệu suất mà còn về chi phí tổng thể để hoàn thành công việc, cuối cùng mang lại lợi ích cho nhà phát triển.

QTiêu chí đánh giá mô hình AI cho lập trình đang thay đổi như thế nào theo bài viết?

ATheo bài viết, tiêu chí đánh giá đang dịch chuyển từ việc chỉ hỏi 'Mô hình này có điểm số cao không?' hay 'Giá mỗi triệu token là bao nhiêu?' sang một câu hỏi thực tế hơn: 'Để mô hình này hoàn thành nhiệm vụ cụ thể này, tổng chi phí tôi phải trả là bao nhiêu?'. Điều này phản ánh sự trưởng thành của thị trường, nơi hiệu quả tổng thể và chi phí vận hành (TCO) trở nên quan trọng ngang bằng, thậm chí hơn cả, điểm số benchmark thuần túy.

你可能也喜歡

知名经济学家猛烈抨击美联储近期政策:“他们在朝错误的方向前进”

知名经济学家詹姆斯·E·托恩严厉批评美联储针对通胀的强硬货币政策。他认为,当前物价压力主要由能源成本、住房短缺、生产缩减等供给侧限制因素推动,而非单纯由需求过热引起。托恩指出,美联储主席凯文·沃什及华尔街圈子错误地将供给驱动的通胀视为经典的、由过度需求引起的经济过热问题。 托恩强调,全职就业数据下降可能反映了经济结构性转型,而非短暂异常,这表明劳动力市场正在适应变化的财政政策与产业条件,而非经济过热。同时,住房市场作为对利率最敏感的领域,正直接承受紧缩政策的压力,而非制造通胀。 他认为,近期美国经济增长主要源于前政府旨在刺激供给的经济政策以及长期投资周期(如对人工智能、数据中心、电力生产和基础设施的投资),而非信贷驱动的普遍过热。在此情况下进一步加息,不仅难以抑制通胀,反而可能削弱经济生产潜力,阻碍生产能力扩张。 托恩补充道,根据经典经济理论,石油价格冲击或关税导致的供给侧冲击通常只会造成一次性价格水平上升,而非持续性的自我强化通胀进程。他认为没有证据表明经济中的中性实际利率(r*)在短期内大幅上升。 托恩的核心质疑是:在面临全职就业萎缩和住房市场持续承压的情况下,美联储进一步收紧货币政策是否明智。他警告称,新的加息行动可能并非审慎控通胀,而是源于对经济形势的误判,错误地将面临供给限制和结构性转型的经济当作过热来处理,从而演变为对需求的刻意压制。

cryptonews.ru3 小時前

知名经济学家猛烈抨击美联储近期政策:“他们在朝错误的方向前进”

cryptonews.ru3 小時前

切勿轻信,务必核实:AI恶意链接揭示了加密货币行业工作者的可怕现实

生成式人工智能技术日益普及,加密货币和区块链行业从业者经常在工作中使用此类工具。然而,这个群体也成为黑客的重点目标,其难以撤销的敏感信息面临被盗风险。近日,Refi Hub联合创始人Numa Lunah称自己遭遇了“黑客攻击”。 他描述,攻击始于Claude聊天界面推荐的一个“录音转文字应用”下载链接。该链接指向一个伪造网站,其中包含恶意软件。他执行命令后,恶意软件立即运行并试图窃取所有信息。尽管他及时清理了笔记本电脑并重装系统,未导致敏感信息泄露,但在后续从备份恢复数据时,他发现一个名为SKILL.md的Claude代码文件已被感染。该文件外观与他的代码风格指南无异,内部却隐藏了指令,会在每次AI加载该文件时重新下载恶意软件并窃取凭证。 这不是大型语言模型首次提供恶意回复。此前,微软专家已警告,攻击手段已从简单的搜索引擎优化投毒升级为“污染”LLM的回复。此类攻击可来自Gemini、Claude、Copilot、ChatGPT等模型,形式包括:通过上下文窗口传播的恶意文件、聊天机器人推荐的黑客可控下载链接、假冒AI品牌的安装程序,以及受感染的源代码和智能体技能。 对加密货币从业者而言,安全隐患尤为严峻,因为其设备上可能存有无法撤销访问权限的敏感数据,例如助记词、私钥文件、交易所提现API密钥、部署密钥、Lightning网络凭据、硬件钱包相关数据以及中心化交易所的会话Cookie等。 分析指出,最危险的漏洞可能是人类的信任与惰性。当前需要一场安全文化的根本转变:从业者必须对自动化工具保持全面警惕,将AI的每个建议都视为潜在威胁。这并非过度谨慎,而是生存必需。此事件中,Refi Hub联合创始人得以幸免,正是因为他坚持在让AI接触前,仔细检查了每一个设置文件、钩子和配置。遗憾的是,多数AI用户很可能不会核实AI提供信息的真实性,而是出于难以解释的原因盲目信任。

cryptonews.ru3 小時前

切勿轻信,务必核实:AI恶意链接揭示了加密货币行业工作者的可怕现实

cryptonews.ru3 小時前

Grayscale 点名三种加密货币:可能从美国国债增长中受益

灰度公司(Grayscale)研究主管扎克·潘德尔于8月26日发布分析指出,美国国债的快速增长可能推高对比特币(BTC)、以太坊(ETH)和Zcash(ZEC)的需求。他认为,失控的国债增长削弱了法币信任,促使投资者转向黄金和某些加密货币等替代性储值资产。在数字资产领域,这种所谓的“贬值交易”将主要使比特币、以太坊和Zcash受益。 潘德尔分析称,比特币因其2100万枚的硬上限和去中心化发行,在稀缺性上最具说服力;以太坊是去中心化结算网络;Zcash则结合了类似比特币的架构与增强的隐私功能。 文章提及,美国财政部已于8月19日宣布计划扩大长期债券回购规模,以应对债市压力。然而,这些操作旨在改善市场流动性,并未解决导致持续借贷的结构性赤字问题。美国联邦债务总额已于8月18日首次超过40万亿美元。 持续的预算赤字表明债务可能继续攀升。国会预算办公室曾预测,联邦赤字将从2026财年的1.9万亿美元增至2036年的3.1万亿美元。利率上升可能加剧财政压力,同时私人部门为AI基础设施融资的借贷也与国债竞争资本,可能推高利率和联邦融资成本,加剧投资者对长期预算稳定的担忧。财政部将于11月4日提供更多回购细节,而预算办公室预测公众持有的债务占GDP比例将从2026年的101%升至2036年的120%。

cryptonews.ru3 小時前

Grayscale 点名三种加密货币:可能从美国国债增长中受益

cryptonews.ru3 小時前

交易

現貨

熱門文章

如何購買BILL

歡迎來到HTX.com!在這裡,購買Billions Network (BILL)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買Billions Network (BILL)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的Billions Network (BILL)購買Billions Network (BILL)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易Billions Network (BILL)在HTX的現貨市場輕鬆交易Billions Network (BILL)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

814 人學過發佈於 2026.05.07更新於 2026.06.02

如何購買BILL

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 BILL (BILL)幣價的意見。

活动图片