Claude Code Thực Sự Tốn Bao Nhiêu Token? Thử Nghiệm So Sánh Đã Có: Ba Framework Chênh Lha Nhất Đến 30 Lần

marsbitXuất bản vào 2026-07-31Cập nhật gần nhất vào 2026-07-31

Tóm tắt

Mọi người thường nói Claude Code tốn token, nhưng tốn cỡ nào? Một thí nghiệm so sánh gần đây từ đội ngũ Composio đã cung cấp con số. Họ sử dụng cùng một mô hình Kimi K3, chạy qua 3 framework agent (harness) khác nhau – Claude Code, Hermes và Kimi Code – cho 28 nhiệm vụ giống hệt nhau. Kết quả, tỷ lệ thành công tương đương: Kimi Code 22/28, Hermes 21/28, Claude Code 20/28. Điểm khác biệt lớn nằm ở lượng token tiêu thụ. **Cùng một nhiệm vụ, token sử dụng giữa các harness chênh lệch tới 30 lần**. Xét trung vị, Kimi Code dùng ~61k token, Hermes ~67k token, còn Claude Code lên tới 340k token, gấp khoảng 6 lần Kimi Code. Với giá Kimi K3 là 3 USD/triệu token input, chi phí trung bình mỗi nhiệm vụ là: **Kimi Code 0.22 USD, Hermes 0.28 USD, Claude Code 2 USD**. Về tốc độ, Hermes nhanh nhất (179 giây), tiếp đến là Kimi Code (297 giây) và Claude Code (348 giây). Bài học rút ra: để giảm chi phí agent, việc lựa chọn harness quan trọng không kém, thậm chí hơn cả việc đổi mô hình. Dữ liệu cho thấy harness có thể tạo ra chênh lệch chi phí tới 9 lần, trong khi hiệu năng mô hình lại tương đồng. Sebastian Raschka chỉ ra nguyên nhân có thể do Claude Code trong quá trình chạy đa bước (multi-step) có xu hướng đưa nhiều ngữ cảnh lịch sử hơn (tin nhắn cũ, lệnh, kết quả tool, nội dung file) vào prompt mỗi lượt, làm tăng token input chứ không phải token output. Một nghiên cứu từ Writer càng khẳng định tầm quan trọng của harness. Thí nghiệm kiểm soát biến số cho thấy chỉ việc thay harness có thể g...

Mọi người đều nói Claude Code lãng phí Token, nhưng thực sự lãng phí đến mức nào? Lần này cuối cùng cũng có người tính ra con số.

Gần đây có một thử nghiệm so sánh khá thú vị, đến từ nhóm Composio. Họ đã sử dụng cùng một mô hình Kimi K3, đưa vào ba framework (harness) agent khác nhau để chạy — Claude Code, Hermes và Kimi Code — tổng cộng thử nghiệm 28 nhiệm vụ hoàn toàn giống nhau.

Kết quả, tỷ lệ thành công của ba harness khi hoàn thành nhiệm vụ tương đương nhau: Kimi Code thành công 22/28, Hermes thành công 21, Claude Code thành công 20. Khoảng cách không lớn.

Thứ thực sự tạo ra sự khác biệt, là mức tiêu thụ token. Một nhiệm vụ giống nhau, chạy trên các harness khác nhau, lượng token sử dụng có thể chênh lệch tới 30 lần!

Xét theo giá trị trung vị, Kimi Code sử dụng khoảng 6.1 vạn token, Hermes khoảng 6.7 vạn, còn Claude Code tăng vọt lên 34 vạn, gấp khoảng 6 lần Kimi Code.

Tính theo giá Kimi K3 là 3 đô la cho mỗi triệu token đầu vào (token đầu vào thường chiếm khoảng 95% trong quy trình agent), chi phí trung bình cho mỗi nhiệm vụ là: Kimi Code 0.22 đô la, Hermes 0.28 đô la, Claude Code lên tới 2 đô la. Sự chênh lệch rất rõ ràng.

Tốc độ cũng khác nhau. Thời gian thực hiện trung vị, Hermes nhanh nhất, 179 giây; Kimi Code 297 giây; Claude Code 348 giây.

Vậy nên, nhanh nhất là Hermes, tiết kiệm token nhất là Kimi Code, hai điều này không trùng khớp.

Từ đó, nhóm Composio đưa ra một kết luận trực tiếp: Nếu bạn muốn giảm chi phí agent, trước tiên hãy xem mình đang dùng harness nào, thay vì vội vàng đổi mô hình. Theo dữ liệu của họ, bản thân harness có thể tạo ra sự chênh lệch chi phí lên tới 9 lần, trong khi khả năng thể hiện của các mô hình thực tế lại tương đương nhau.

Sebastian Raschka sau khi xem kết quả này cũng đã đăng bài, nói rằng điều này tương đồng với quan sát của ông trước đây khi dùng Qwen3.6: Claude Code với tỷ lệ thành công tương đương, lượng token sử dụng thường gấp 2 đến 3 lần nhiều harness khác.

Ông đưa ra một vài nguyên nhân có thể: Liệu có phải là chưa được tối ưu hóa nhiều? Có lỗi? Hay là cố tình thiết kế như vậy (vì có thể có ích trong những nhiệm vụ khó hơn)? Ông cho biết cần dành thời gian kiểm tra kỹ lưỡng hơn.

Sau đó, ông bổ sung thêm quan sát từ bài viết của mình tháng trước về coding agent local. Lúc đó ông đã phân tích tại sao Claude Code dùng nhiều token hơn, và phát hiện sự khác biệt chủ yếu nằm ở token đầu vào, chứ không phải token đầu ra. Nói cách khác, Claude không hề viết nhiều gấp đôi nội dung. Nhật ký cho thấy, harness của Claude trong tương tác đa luồng liên tục đẩy thêm nhiều ngữ cảnh trở lại mô hình, bao gồm thông điệp trước đó, lệnh gọi công cụ, đầu ra lệnh và nội dung tệp. Ví dụ, trong một lần chạy Claude sử dụng khoảng 57.8 vạn token đầu vào, nhưng đầu ra chỉ khoảng 4500 token, trải qua 25 lượt. Vì vậy, giải thích khả dĩ hơn là harness của Claude khi chạy đa bước agent, sẽ tích lũy hoặc tính toán lịch sử prompt lớn hơn.

Những kết quả kiểm tra này dường như cho thấy một xu hướng không thể bỏ qua: Tầm quan trọng của harness không thua kém gì bản thân mô hình.

Một bài báo gần đây (từ Writer, một công ty làm nền tảng AI Agent doanh nghiệp) đã hệ thống hóa rõ điều này: Nó sử dụng thử nghiệm biến số kiểm soát chứng minh rằng việc thay đổi lớp harness có tác dụng cắt giảm chi phí mạnh hơn so với việc thay đổi mô hình, và tất cả các mô hình đều được hưởng lợi.

Cụ thể, họ triển khai một thử nghiệm nghiêm ngặt "biến số kiểm soát": Trong điều kiện cố định 22 nhiệm vụ doanh nghiệp và 6 mô hình cơ bản (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), chỉ thay thế lớp điều phối — thay vòng lặp agent cấp sản xuất truyền thống bằng Harness riêng của Writer.

Kết quả thử nghiệm cho thấy: Chi phí trung bình cho mỗi nhiệm vụ giảm 41% (0.21 đô la → 0.12 đô la), độ trễ trung vị rút ngắn 44% (48 giây → 27 giây), lượng tiêu thụ Token giảm 38% (14.2k → 8.8k), trong khi chất lượng hoàn thành nhiệm vụ cơ bản không đổi (0.78 → 0.81, do cỡ mẫu nhỏ có thể coi là không có sự khác biệt đáng kể). Về mặt hiệu quả chi phí, chất lượng có thể đạt được trên mỗi đô la tăng mạnh 82%, đồng thời số nhiệm vụ có thể hoàn thành trên mỗi triệu Token tăng từ 54.9 lên 92.0.

Vậy nên, sau khi mô hình trở thành "điện, nước, khí", harness mới là chiếc máy lạnh quyết định hóa đơn tiền điện? Nói cách khác: Trước đây có người nói "mô hình chính là sản phẩm", bây giờ là "harness chính là sản phẩm"?

Vì harness quan trọng như vậy, vậy thì từ nay về sau hóa đơn có phải cũng nên tính chi tiết hơn?

Có người chỉ ra rằng, chúng ta cần thiết phải thêm mục "thuế harness" vào benchmark hiện tại. Đặc biệt là xét đến việc một khi lệnh gọi công cụ và thử lại rơi vào vòng lặp, mức thuế này không tăng tuyến tính.

Nói cách khác, cuộc đua agent trong tương lai, hiệp một so về "có làm được không", hiệp hai sẽ so về "làm việc giống nhau, ai tiết kiệm hơn" — và bí mật tiết kiệm tiền, không nằm ở mô hình, mà nằm ở harness.

Trong quá trình chạy Agent, bạn đã từng có trải nghiệm tương tự chưa? Chào mừng thảo luận tại phần bình luận.

Bài viết từ tài khoản công chúng WeChat "Cỗ máy Chi Tâm" (ID:almosthuman2014), tác giả: Cỗ máy Chi Tâm

Nội dung Liên quan

Tin xấu cho những người đang chờ đợi một đợt sụp đổ lớn của Bitcoin (BTC): Nhà phân tích nổi tiếng đã nói rất rõ về điều này!

Tin tức xấu cho những ai đang mong đợi Bitcoin (BTC) lao dốc mạnh: một nhà phân tích nổi tiếng đã đưa ra nhận định rất rõ ràng! Trong bối cảnh Bitcoin tiếp tục dao động quanh mức 64.000 USD, nhà phân tích Killa, một chuyên gia có uy tín trên thị trường tiền điện tử, tuyên bố rằng BTC đã chạm đáy và ông không kỳ vọng một đợt sụt giảm mạnh. Nhà phân tích này cho rằng khả năng Bitcoin giảm xuống vùng 36.000-48.000 USD như nhiều nhà đầu tư dự đoán là rất thấp. Dựa trên phân tích các chu kỳ giá trước đây, ông lập luận rằng Bitcoin thường tạo ba đáy chính và hai đáy cuối là then chốt. Sau khi giảm về khoảng 59.000 USD, Bitcoin đã hình thành sự phân kỳ tăng nhẹ, và áp lực bán không đủ để đẩy giá xuống thêm nữa, cho thấy thị trường đang củng cố chứ không suy yếu. Theo Killa, Bitcoin hiện đang trong một phạm vi tích lũy rõ ràng với mốc hỗ trợ quan trọng quanh 57.000 USD. Mặc dù có thể có những đợt giảm ngắn hạn dưới mức này, nhưng đó không phải dấu hiệu của một thị trường giảm giá mới. So sánh với các xu hướng lịch sử, một đợt giảm mạnh và kéo dài xuống vùng 36.000-48.000 USD không phù hợp với cấu trúc thị trường hiện tại. Nếu một đợt lao dốc như vậy xảy ra, nó đáng lẽ phải diễn ra sớm hơn.

cryptonews.ru1 giờ trước

Tin xấu cho những người đang chờ đợi một đợt sụp đổ lớn của Bitcoin (BTC): Nhà phân tích nổi tiếng đã nói rất rõ về điều này!

cryptonews.ru1 giờ trước

AMLBot ra mắt AI Tracer để tự điều tra blockchain

Công ty phân tích tuân thủ và điều tra tiền điện tử AMLBot đã ra mắt công cụ AI Tracer, một nền tảng phân tích blockchain tự phục vụ. Công cụ này tự động lập bản đồ dòng tiền từ một mã hash giao dịch xuyên suốt các mạng blockchain, bao gồm cả việc theo dõi qua các cầu nối cross-chain và khi tài sản bị chia nhỏ vào nhiều ví. AI Tracer được thiết kế để đơn giản hóa việc truy vết, vốn thường yêu cầu phần mềm và kiến thức chuyên môn. Nó tự động duyệt qua biểu đồ giao dịch, theo dõi chuyển động tiền và đối chiếu các địa chỉ ví với nhãn của các thực thể đã biết như sàn giao dịch, dịch vụ hoặc địa chỉ bị cảnh báo. Công ty lưu ý rằng công cụ có giới hạn: không thể thấy giao dịch nội bộ trên sàn, xác định lý do thanh toán, đóng băng tài sản hay đảm bảo thu hồi tiền. Báo cáo từ AI Tracer chỉ nhằm cung cấp điểm khởi đầu cho các cuộc điều tra và không thay thế quy trình kiểm toán hay pháp lý. AI Tracer cung cấp kiểm tra miễn phí và các gói trả phí với giới hạn cao hơn. Hiện tại, nó hỗ trợ nhiều mạng lưới blockchain lớn như Bitcoin, Ethereum, BNB Chain, Solana, Cardano, Ripple, Polygon, Arbitrum và nhiều mạng khác. Đối tượng mục tiêu bao gồm nhà báo, nhà nghiên cứu, trader, người dùng crypto, cơ quan thực thi pháp luật và các đội tuân thủ.

cointelegraph2 giờ trước

AMLBot ra mắt AI Tracer để tự điều tra blockchain

cointelegraph2 giờ trước

Cổ phiếu sụt giảm còn mạnh hơn cả thị trường tiền điện tử, tiền đã đi đâu?

Tác giả Cathy từ Nền tảng Blockchain Bạch thoại phân tích về đợt sụt giảm mạnh của thị trường chứng khoán toàn cầu gần đây, đặc biệt là sự sụp đổ của chỉ số Kospi Hàn Quốc với mức giảm kỷ lục và việc kích hoạt cơ chế ngắt mạch. Bài viết chỉ ra rằng đây không phải là sự sụt giảm của một cổ phiếu riêng lẻ, mà là một đợt "giảm đòn bẩy cưỡng chế" toàn cầu, nhắm vào các lĩnh vực được giao dịch quá mức như bán dẫn. Đáng chú ý, trong khi các cổ phiếu công nghệ và ETF có đòn bẩy lao dốc (ví dụ: ETF 2x SK Hynix giảm 83%), Bitcoin lại thể hiện sự ổn định tương đối, thậm chí có mức tăng nhẹ, trái ngược với hình ảnh biến động thường thấy. Nguyên nhân được cho là do các lệnh thanh lý cưỡng chế từ các nhà đầu tư sử dụng đòn bẩy cao và quỹ phòng hộ, được kích hoạt bởi báo cáo lợi nhuận không đạt kỳ vọng của SK Hynix và các yếu tố từ Trung Quốc (như đợt IPO của CXMT). Áp lực từ việc chấm dứt giao dịch carry-trade bằng đồng Yên cũng góp phần vào làn sóng bán tháo. Bài viết lập luận rằng dòng tiền từ thị trường chứng khoán không chảy vào Bitcoin. Thay vào đó, Bitcoin "trông có vẻ ổn định" vì đã trải qua một đợi điều chỉnh sâu và bán tháo mạnh từ tháng 5 đến tháng 6, với dòng tiền ròng rất lớn rút khỏi các ETF Bitcoin. Dòng tiền thực sự tìm đến nơi trú ẩn an toàn là vàng. Bitcoin và vàng hiện có tương quan nghịch rất mạnh, cho thấy Bitcoin hiện được coi là tài sản mạo hiểm để tìm kiếm lợi nhuận, chứ không phải là "vàng kỹ thuật số" để phòng ngừa rủi ro. Kết luận cho rằng để dòng tiền lớn quay trở lại với Bitcoin, cần ba điều kiện: áp lực thanh khoản toàn cầu giảm bớt, Fed cắt lãi suất mà không gây suy thoái, và quan trọng là dự luật CLARITY được thông qua để giải quyết các vấn đề pháp lý. Tuy nhiên, việc Bitcoin thể hiện mối tương quan thấp với thị trường chứng khoán (đặc biệt là Nasdaq) trong đợt biến động này có thể lại là điểm hấp dẫn đối với các định chế tài chính đang tìm kiếm sự đa dạng hóa danh mục sau khi tập trung quá mức vào AI. Vị thế của Bitcoin vẫn còn đó, chỉ chờ dòng tiền toàn cầu quay trở lại.

marsbit2 giờ trước

Cổ phiếu sụt giảm còn mạnh hơn cả thị trường tiền điện tử, tiền đã đi đâu?

marsbit2 giờ trước

Giao dịch

Giao ngay
活动图片