Cùng một mô hình, giá chính thức chỉ giảm 20%, hóa đơn của bạn lại giảm đến 80%.

Ngày 24 tháng 8, OpenAI đã công bố kết quả thử nghiệm thực hiện cùng với AWS:
Trên Terminal-Bench 2.1, chi phí để GPT-5.6 Terra hoàn thành một nhiệm vụ thành công trong Kiro, đã giảm khoảng 82%.
Kiro là nền tảng trí tuệ nhân tạo phát triển phần mềm của AWS, bao phủ IDE, CLI và Web.
Ba anh em Sol, Terra, Luna trong gia đình GPT-5.6 đã chạy trong đó hơn một tháng.
82% này, không phải là mức giảm giá chính thức.
Lần điều chỉnh giá gần đây nhất của Terra là vào ngày 30 tháng 7, với mức 20%.

Thông báo điều chỉnh giá của OpenAI ngày 30/7, Terra giảm 20%.
Đơn giá chỉ giảm 20%, nhưng hóa đơn lại có thể cắt giảm 80%.
Sáu mươi phần trăm chênh lệch ở giữa được tiết kiệm từ đâu, mới là điều thực sự đáng để chúng ta chú ý.
Việc GPT-5.6 đổ bộ lên Kiro là chuyện của tháng 7 năm nay.
Đầu tiên là ngày 13, AWS thông báo GPT-5.6 Sol, Terra, Luna đã chính thức khả dụng trên Amazon Bedrock.
Tiếp ngay ngày hôm sau, Kiro đăng blog thông báo ba mô hình đã lên sàn trên IDE, CLI và Web.

Đây là lần đầu tiên mô hình của OpenAI vào Kiro, vừa kịp dịp Kiro công khai xem trước được một năm.
Đưa mô hình lên kệ trước, rồi kéo đi làm việc, hơn một tháng sau, OpenAI quay lại nộp bài:
Hai bên hợp tác điều chỉnh một lượt môi trường Kiro và mô hình OpenAI, chi phí để Terra hoàn thành một nhiệm vụ thành công, đã giảm khoảng 82%.
Tiền tiết kiệm được
Là tiền đi đường vòng
Lần điều chỉnh giá ngày 30 tháng 7, Terra giảm 20%, nhưng trong thử nghiệm của Kiro, chi phí đơn nhiệm vụ lại giảm 82%.
Sáu phần mười tiết kiệm thêm đó, là từ đâu ra?
Hướng chỉ có mấy cái này:
Mô hình nhả ra ít token hơn, số lần gọi đi gọi lại công cụ ít hơn, số lần thử lại và đi đường vòng sau khi thất bại ít hơn.
Vì vậy, khoản tiết kiệm lớn này, không phải là tiền cho mỗi lần gọi, mà là tiền cho những lần gọi đáng lẽ sẽ bị lãng phí.
Đạo lý rất đơn giản: Một AI agent làm hỏng nhiệm vụ một lần, hóa đơn vẫn tính. Nó chọn sai đường giữa chừng, chạy lệch ba vòng rồi quay đầu, những token này cũng tính tiền như thường.
Trong phát triển thực tế, tiền thường rò rỉ theo cách này.
OpenAI trong blog chính thức cũng chỉ ra cùng một logic, hiệu quả đến từ ba tầng:
Khung agent khởi tạo yêu cầu, tổ chức ngữ cảnh, hệ thống điều phối trung gian điều động yêu cầu, cuối cùng mới là chính mô hình chạy trên GPU.

OpenAI phân tích nguồn gốc hiệu quả của GPT-5.6: Yêu cầu xuất phát từ khung agent, được hệ thống điều phối lên lịch, cuối cùng đến GPU chạy mô hình, mỗi tầng đều tiết kiệm.
Tiết kiệm tiền còn có thể tiết kiệm đến phân công mô hình.
OpenAI cũng từng nêu một cách dùng: Quy trình làm việc viết code có thể dùng Sol để suy nghĩ rõ vấn đề, định ra kế hoạch trước, sau đó đổi sang Luna để thực hiện những thay đổi đã được xác định rõ ràng, viết test, chạy đánh giá.
Cùng một dây chuyền, các khâu khác nhau phối hợp trí thông minh ở các phân khúc khác nhau.
Mô hình chỉ chiếm một nửa hóa đơn
Đổi khung là đổi giá
Bộ đề Terminal-Bench 2.1 này, không phải để mô hình làm bài một mình.
Nó ném mô hình vào một môi trường terminal, đưa ra một mục tiêu mơ hồ, để nó tự lên kế hoạch đường đi, gọi công cụ, viết script, xử lý báo lỗi, lặp đi lặp lại.
Vì vậy, điểm số chạy ra, là điểm số của tổ hợp "agent + mô hình".

Bảng xếp hạng công khai Terminal-Bench 2.1, bên phải tỷ lệ chính xác có thêm một mục chi phí. (Nguồn: Terminal-Bench)
Bốn dòng số trong bảng xếp hạng nói rõ vấn đề nhất:
Claude Code với Fable 5, 83.8%, 552.67 USD;
Codex với GPT-5.5, 83.1%, 2059.19 USD;
Codex với GPT-5.6 Terra, 78.4%, 421.15 USD;
Codex với GPT-5.6 Luna, 75.7%, 241.45 USD.
Hai dòng đầu điểm số chỉ chênh 0.7 phần trăm, hóa đơn lại chênh gần 4 lần.
Cùng một mô hình, lắp vào các khung khác nhau, phối hợp chiến lược tổ chức ngữ cảnh và công cụ khác nhau, chạy ra cũng hoàn toàn không phải một mức giá.
Theo dữ liệu chính thức Kiro cung cấp, Terra trên Coding Agent Index đạt 77.4 điểm, chỉ cao hơn một chút so với 77.2 điểm của Claude Fable 5.
Điểm bán hàng của nó không nằm ở điểm số, mà nằm ở mức giá tương ứng với điểm số này.
Điểm phát lực spec-driven của bộ Kiro đó cũng ở đây, cách chơi cốt lõi chỉ một câu: Không được lên là viết code.
Nó trước tiên tách mục tiêu mơ hồ của người dùng thành tài liệu yêu cầu chính thức, thiết kế kỹ thuật và danh sách nhiệm vụ có thể thực thi, rồi mới giao cho mô hình.
Như vậy, thứ mô hình nhận được không còn là một câu nói mập mờ, mà là một mớ việc đã được sắp xếp rõ ràng.
Người quen thuộc với Agent sẽ lập tức phản ứng, bước này tiết kiệm chính là phần chi phí đắt đỏ nhất.
Mô hình chạy lệch, làm lại, đập đi xây lại, số token đốt cháy thường còn nhiều hơn làm việc chính thức.
Kiro còn để lại hai rào chắn trong quy trình: Trước khi mã thực sự được sửa, dừng lại để người xem qua một lượt; sau khi việc hoàn thành, tự động chạy một lượt test để xác minh đúng sai.
Mỗi lần làm lại bị hai rào chắn này ngăn lại, đều có thể tiết kiệm tiền thật.
Claude trong lãnh địa của Amazon
GPT chiếm mất một nửa
Một năm trước, Kiro chỉ là một IDE spec-driven, bộ chọn mô hình là sân nhà của Anthropic.
Một năm sau, AWS trên nền tảng trí tuệ nhân tạo phát triển phần mềm của chính mình, một lúc đưa vào ba phân khúc mô hình của OpenAI.
Sol, Terra, Luna xếp hàng cùng Claude vào cùng một menu thả xuống, cảnh tượng này đặt một năm trước khó mà tưởng tượng.
Mặc dù GPT-5.6 lần này là "cả nhà đóng quân", nhưng không phải "mở cửa toàn diện".
Ba mô hình được mở theo kiểu tiệm tiến, thử nghiệm, hướng đến người dùng Pro, Pro+, Pro Max và Power, khu vực chỉ có hai, Bắc Virginia của Mỹ và Frankfurt của châu Âu, hỗ trợ suy luận xuyên khu vực.
Còn có một điều khá nhiều người không quen: Nhóm mô hình này trong Kiro chạy theo chuỗi suy nghĩ ẩn, bạn không nhìn thấy các bước lập luận của nó, chỉ nhìn thấy kết quả cuối cùng.
Người quen theo dõi Agent lập luận từng bước, sẽ cảm thấy như ném việc vào một cái hộp không trong suốt.
Cách nói chính thức là, đây là hành vi dự kiến, không ảnh hưởng chất lượng đầu ra.
Ba phân khúc mô hình trong Kiro được niêm yết giá rõ ràng.
Ngày 14 tháng 7 vừa lên sàn lúc đó, cùng một nhiệm vụ, Sol trừ 2.4 lần, Terra trừ 1.2 lần, Luna trừ 0.6 lần.
Ngày 30 tháng 7 đợt giảm giá của OpenAI hạ cánh, ngày hôm sau Kiro theo kịp: Luna từ 0.6 lần cắt thẳng xuống 0.1 lần, Terra từ 1.2 lần giảm xuống 1.0 lần, chỉ có Sol là không động.

Thái độ của AWS đã đặt rõ trên mặt bàn: Một nền tảng phát triển, không thể chỉ buộc vào một mô hình.
Trong cùng một bộ chọn, hai mô hình tiên phong bắt đầu đè giá lẫn nhau.
Tiêu chuẩn đánh giá mô hình cũng thay đổi theo: Điểm cao không còn mặc định là thắng, tiêu ít tiền cũng có thể thắng.
Đối với nhà phát triển, chọn mô hình trước đây hỏi là "mô hình này bao nhiêu tiền một triệu token", bây giờ phải hỏi "để nó làm xong việc này, rốt cuộc tôi phải trả bao nhiêu".
Tài liệu tham khảo:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
Bài viết này từ tài khoản WeChat công chúng "Tân Trí Nguyên" (ID: AI_era), tác giả: ASI Khải Thị Lục, biên tập: Nguyên Vũ






