
Vừa mới đây, Anthropic đã đăng một blog.
Thông tin cốt lõi là: Tất cả mọi người, đừng đốt token một cách phí phạm nữa, chúng tôi không thể tiếp tục nhìn thấy nữa!

Vì vậy, phía chính thức đã liệt kê chi tiết sáu bí quyết tiết kiệm tiền, dán ngay ở đây:
1. /clear ngay khi hoàn thành nhiệm vụ. Sửa xong một lỗi thì xóa cuộc trò chuyện hiện tại, đừng kéo những file đã đọc và đầu ra lệnh từ nhiệm vụ trước vào nhiệm vụ sau, chiếm dụng ngữ cảnh một cách vô ích.
2. Ngay từ đầu đã xác định mô hình và cường độ suy luận (effort level). Nếu chuyển đổi giữa chừng, bộ đệm gợi ý tích lũy trước đó sẽ mất hiệu lực toàn bộ, toàn bộ lịch sử cuộc trò chuyện phải được tính toán lại với giá đầy đủ.
3. Dùng @ để trích dẫn file, đừng gõ tay đường dẫn. Dùng @ đính kèm trực tiếp file vào tin nhắn, Claude không cần tốn thêm một lần gọi công cụ để đọc. Nếu bạn chỉ gõ tên file, Claude có thể sẽ tìm kiếm một lượt trước rồi mở thử vài file, tất cả các thao tác này đều sẽ đi vào lịch sử cuộc trò chuyện và được mang theo mỗi vòng sau đó.
4. Thêm tham số im lặng (quiet flag) cho các lệnh có đầu ra nhiều. Trong CLAUDE.md viết một dòng cấu hình kiểu như --reporter=dot, để đầu ra kiểm thử chỉ in vài dòng tóm tắt, không phải hàng trăm dòng chi tiết. Đầu ra càng ngắn, chiếm ngữ cảnh càng ít.
5. Thực hiện /compact trước khi nghỉ ngơi. Nén khi cuộc trò chuyện còn trong bộ đệm, chi phí chỉ bằng một phần mười so với bình thường. Nếu đợi đến lúc bạn quay lại, bộ đệm đã hết hạn rồi mới nén, thì phải đọc lại toàn bộ với giá đầy đủ rồi mới nén.
6. Giao nhiệm vụ đầu ra lớn cho Agent con. Agent con chạy trong một cửa sổ ngữ cảnh độc lập, khi làm xong chỉ truyền kết luận về, những file đã đọc và đầu ra lệnh chạy trong quá trình sẽ không đi vào cuộc trò chuyện chính của bạn.

Cuộc đời trước sau của một token
Dùng Claude Code làm việc, API tính theo lượng dùng, phí thuê bao hàng tháng chia ba mức từ 20 USD đến 200 USD.
Theo tính toán của chính thức, nhà phát triển tiêu thụ trung bình 13 USD token mỗi ngày, chi tiêu hàng tháng rơi vào khoảng 150 đến 250 USD.
Đây mới chỉ là mức trung bình. Cùng sửa một lỗi, cách hỏi khác nhau, chi phí có thể chênh lệch gấp vài lần.
Và mỗi vòng trò chuyện đều kéo theo toàn bộ nội dung của tất cả các vòng trước đó gửi lại, phiên càng dài, mỗi vòng càng đắt.
Số tiền này tiêu vào đâu, phải nói từ logic định giá token.

Mỗi lần bạn nhập một chỉ lệnh trong Claude Code, đằng sau xảy ra hai việc.
Việc thứ nhất gọi là tiền điền (prefill), tức là mô hình đọc một hơi toàn bộ yêu cầu của bạn, bao gồm gợi ý hệ thống, CLAUDE.md, tin nhắn của bạn, cùng mọi thứ tích lũy trong cuộc trò chuyện trước đó. Tất cả những thứ này là token đầu vào.
Việc thứ hai gọi là giải mã (decode), tức là quá trình mô hình viết ra từng chữ một, bao gồm suy nghĩ của nó, gọi công cụ và văn bản bạn cuối cùng nhìn thấy. Tất cả những thứ này là token đầu ra.
Điểm khác biệt then chốt ở đây.
Tiền điền là song song, đưa tất cả token đầu vào qua GPU một lần. Giải mã là nối tiếp, mỗi lần nhả ra một token đều phải chạy một lần mô hình. Phản hồi 200 token, tức là 200 lần tính toán độc lập.
Vì vậy cũng không khó hiểu, tại sao token đầu ra lại đắt hơn token đầu vào 5 lần.

Trên cơ sở này, hóa đơn cuối cùng phụ thuộc vào hai việc.
Thứ nhất là mô hình, quyết định đơn giá mỗi token.
Opus 5, đầu vào 5 USD/triệu token, đầu ra 25 USD.
Sonnet 5, đầu vào 2 USD, đầu ra 10 USD.
Haiku 4.5, đầu vào 1 USD, đầu ra 5 USD.
Thứ hai là cường độ suy luận, quyết định số lượng token.
Phần lớn token đầu ra trong một phiên đều là token suy nghĩ, cường độ suy luận kiểm soát chính là lượng này. Cường độ suy luận càng cao, mô hình nghĩ càng lâu, token suy nghĩ đầu ra càng nhiều. Giữa max và low có thể chênh lệch vài lần.
Dùng Sonnet cho việc đơn giản, chỉ dùng Opus cho việc khó. Tiền dùng dao mổ trâu giết gà, tiêu một cách oan uổng nhất.

Bộ đệm gợi ý, là công cụ tiết kiệm tiền lớn nhất
Trong định giá token còn có một biến số khổng lồ, đó là bộ đệm.
Mỗi yêu cầu của Claude Code đều bắt đầu từ tiền tố giống nhau, tức là gợi ý hệ thống, định nghĩa công cụ, CLAUDE.md và lịch sử cuộc trò chuyện.
Nếu tiền tố của yêu cầu lần này hoàn toàn giống từng byte so với lần trước, máy chủ sẽ không tính toán lại, mà trực tiếp tải kết quả tính toán lần trước.
Đọc bộ đệm chỉ tốn 0.1 lần giá đầu vào bình thường, trực tiếp tiết kiệm 90%.
Ghi vào bộ đệm đắt hơn một chút, cao nhất là 2 lần. Nhưng ghi chỉ xảy ra một lần, mỗi vòng sau đó đều được hưởng mức đọc 0.1 lần.
Lấy một ví dụ.
Giả sử lịch sử cuộc trò chuyện của bạn có 5 vạn token. Nếu không đi qua bộ đệm, mỗi vòng chỉ riêng việc đọc lại 5 vạn token này đã phải trả giá đầy đủ. Nhưng chỉ cần trúng bộ đệm, cùng 5 vạn token đó chỉ cần tốn một phần mười số tiền.
Một phiên chạy hai ba chục vòng, khoản chiết khấu tích lũy được từ trúng bộ đệm là một con số khổng lồ.
Đây là đòn bẩy 'hái lông cừu' lớn nhất của bạn.

Nhưng bộ đệm có một điểm yếu chí mạng. Nó phải khớp liên tục từ byte đầu tiên của yêu cầu, bất cứ chỗ nào ở giữa thay đổi, từ đó về sau toàn bộ sẽ vô hiệu.
Cụ thể, tổng cộng có sáu tình huống:
1. /model chuyển mô hình: Bộ đệm của mỗi mô hình độc lập. Chuyển từ Sonnet sang Opus, toàn bộ lịch sử cuộc trò chuyện được tiền điền lại với giá Opus, không có chiết khấu.
2. /effort chuyển cường độ suy luận: Cường độ suy luận cũng là một phần của khóa bộ đệm, sau khi chuyển toàn bộ lịch sử cuộc trò chuyện đều phải tính toán lại.
3. Bật/tắt Fast mode: Hiệu quả giống hai loại trước, bộ đệm trực tiếp mất hiệu lực.
4. /compact nén cuộc trò chuyện: Cuộc trò chuyện được viết lại thành tóm tắt, nội dung cũ hoàn toàn không khớp, bộ đệm cũ trực tiếp vô hiệu.
5. Hết thời gian: Bộ đệm của người dùng thuê bao được giữ sống 1 giờ, người dùng API mặc định 5 phút. Quá thời gian, vòng tiếp theo tính toán lại toàn bộ.
6. Khôi phục phiên cũ: Cách quá lâu bộ đệm đã mất từ lâu, gần như 100% phải tính toán lại với giá đầy đủ.
Tin xấu là, chỉ cần trúng một cái có nghĩa là toàn bộ lịch sử cuộc trò chuyện từ 0.1 lần quay trở lại giá gốc.
Tin tốt là, khi bạn biết điều gì sẽ làm bộ đệm mất hiệu lực, bạn sẽ biết cách bảo vệ nó.
Ví dụ, ngay từ đầu phiên đã khóa mô hình và cường độ suy luận, cả phiên không chuyển. Không thực hiện /compact khi bộ đệm còn nóng, đợi đến lúc chuẩn bị nghỉ ngơi mới chạy.
Ở đây, còn có một cái bẫy ẩn.
Chế độ opusplan mỗi lần vào ra plan đều chuyển mô hình. Vào một lần, bộ đệm mất hiệu lực một lần. Ra, lại mất hiệu lực một lần. Nếu nhảy qua nhảy lại, mỗi lần nhảy đều là một lần tiền điền toàn giá.
Phiên của bạn, đang âm thầm phát phì
Bộ đệm giúp bạn giảm chi phí gửi lại lịch sử lặp đi lặp lại xuống còn một phần mười.
Nhưng có một việc nó không giúp được. Bản thân lịch sử của bạn đang phình ra từng vòng một.
Mỗi lần Claude đọc một file, nội dung file được thêm vào cuộc trò chuyện. Mỗi lần Claude chạy một lệnh, đầu ra cũng được thêm vào. Từ vòng thêm đó trở đi, mỗi vòng sau đều mang theo.
Vòng trò chuyện thứ 40 đang gửi lại toàn bộ nội dung tích lũy từ vòng 1 đến vòng 39.
Sự tăng trưởng này, là mức gần như bình phương O(n2).

Claude Code có một cơ chế đáy.
Đầu ra lệnh vượt quá 30000 ký tự, sẽ không nhét vào cuộc trò chuyện nữa, mà viết vào một file tạm thời, trong cuộc trò chuyện chỉ để lại một câu tóm tắt. Nhưng đầu ra dưới 30000 không ai quản.
Ví dụ một framework kiểm thử chạy xong, in 400 dòng ghi nhận đạt, mỗi dòng vài chục ký tự, tổng lượng chưa đến 3 vạn, không đạt ngưỡng này.
Thế là 400 dòng này nguyên vẹn ở lại trong lịch sử cuộc trò chuyện, mỗi vòng sau đều kéo theo gửi lại một lần.
Đối với điều này, blog của Anthropic đã đưa ra vài chiêu giảm béo rất thiết thực.
1. Dùng @ trích dẫn file.
Đừng nhập tay đường dẫn để Claude tự đi tìm. @ trích dẫn sẽ đính kèm trực tiếp file vào tin nhắn, tiết kiệm một thao tác đọc.
Nếu bạn chỉ nói tên file, Claude có thể sẽ grep tìm một lượt trước, mở ra vài file xem cái nào đúng. Rồi những lần thử nghiệm này sẽ toàn bộ đi vào lịch sử cuộc trò chuyện, chỉ tăng thêm chi phí.

2. Thêm quiet flag cho các lệnh ồn ào.
Trong CLAUDE.md viết một dòng "run tests with npx vitest run --reporter=dot", sau này mỗi lần chạy kiểm thử chỉ xuất vài dòng kết quả dạng chấm, không phải hàng trăm dòng chi tiết. Một phút cấu hình, mỗi phiên sau tiết kiệm vài trăm dòng ngữ cảnh.
3. Dùng subagent để cách ly nhiệm vụ đầu ra lớn.
Subagent chạy trong cửa sổ ngữ cảnh độc lập của riêng nó, làm xong chỉ truyền đáp án về, những file đã đọc và đầu ra lệnh trong quá trình toàn bộ bị loại bỏ. Phù hợp với những việc kiểu "đi lục lại log xem có gì bất thường", "giúp tôi xem qua file lớn này". Bạn chỉ cần kết luận, không cần quá trình.

Còn có một điều quan trọng nhất.
4. /clear khi chuyển nhiệm vụ.
Sửa xong một lỗi thì /clear, bắt đầu việc tiếp theo. File, đầu ra lệnh, khám phá trung gian của lỗi trước, tất cả đều không liên quan đến nhiệm vụ sau, nhưng nếu không xóa, chúng ở mỗi vòng sau đều chiếm vị trí, ăn token.
Nếu không muốn xóa sạch hoàn toàn, /compact có thể nén cuộc trò chuyện thành tóm tắt. Một vạn đến hai vạn token có thể nén xuống còn một nghìn đến ba nghìn.

Ngoài ra, trong blog còn đề cập một thao tác ít người biết nhưng miễn phí, /rewind.
Nếu vài vòng cuối chạy lệch hướng, /rewind trực tiếp cắt bỏ mấy vòng đó, bộ đệm phía trước hoàn toàn không động.

Quản lý token, cũng là một loại tố chất của nhà phát triển
Phân tích xong các thao tác trên, bạn sẽ phát hiện một quy luật. Người viết code đang mọc ra một bộ kỹ năng mới.
Không liên quan đến framework và ngôn ngữ, mà là biết nên chọn mô hình nào, quản lý ngữ cảnh thế nào, bảo vệ bộ đệm ra sao, mở cường độ suy luận bao nhiêu là phù hợp.
Những khả năng này một năm trước không tồn tại. Nhưng giờ đây nó lại quyết định trên cùng một nhiệm vụ, bạn tiêu 3 USD hay 30 USD.
Bản thân Anthropic chính là ví dụ tốt nhất.
80% code của họ nhờ AI viết, lượng hợp nhất code một năm tăng gấp 8 lần, kiểm thử chuẩn tăng tốc 52 lần. Sử dụng AI với cường độ này, nếu không ai quản lý token, chỉ riêng chi phí suy luận đã có thể ăn hết ngân sách.
Từ góc độ này, thay vì nói blog này nói về kỹ năng tiết kiệm tiền, không bằng nói đó là một loại bản năng mới mà người viết code thời đại AI cần mọc ra——
Biết mỗi thao tác của bạn đang tiêu hao cái gì, biết làm thế nào để cùng một ngân sách làm được nhiều việc hơn.
Người đọc hiểu nó, 'hái' được không chỉ là vài USD token.
Tài liệu tham khảo:
https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions
Biên tập: Moses
Bài viết này đến từ tài khoản công chúng WeChat "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục





