Lập trình viên toàn cầu đang 'tặng tiền' cho Anthropic! Phía chính thức cuối cùng cũng không thể tiếp tục im lặng.
Vừa qua, Anthropic đã xuất bản một bài blog chính thức với thông điệp rõ ràng: các lập trình viên đang lãng phí rất nhiều token khi sử dụng Claude Code và cần sử dụng hợp lý hơn để tiết kiệm chi phí. Dưới đây là những phương pháp chính được đề xuất:
1. **/clear sau mỗi nhiệm vụ:** Kết thúc một task (như sửa lỗi), hãy xóa lịch sử hội thoại hiện tại để tránh các file và kết quả lệnh không liên quan làm đầy ngữ cảnh cho task tiếp theo.
2. **Cố định mô hình và cường độ suy luận (effort level) ngay từ đầu:** Việc chuyển đổi giữa các mô hình (như từ Sonnet sang Opus) hoặc thay đổi effort level sẽ khiến bộ nhớ đệm (cache) bị mất hiệu lực, buộc toàn bộ lịch sử hội thoại phải được tính toán lại với mức giá đầy đủ.
3. **Sử dụng @ để tham chiếu file:** Thay vì nhập đường dẫn thủ công, hãy đính kèm trực tiếp file vào tin nhắn bằng ký hiệu @. Điều này giúp Claude đọc file trực tiếp, tránh các thao tác tìm kiếm thử nghiệm tốn token.
4. **Thêm tham số "yên lặng" (quiet flag) cho các lệnh có đầu ra dài:** Cấu hình trong CLAUDE.md để các lệnh như chạy test chỉ xuất ra bản tóm tắt ngắn, giảm đáng kể độ dài văn bản được thêm vào ngữ cảnh.
5. **Sử dụng /compact khi bộ nhớ cache còn "nóng":** Nén hội thoại khi dữ liệu vẫn còn trong cache sẽ chỉ tốn ~1/10 chi phí so với việc thực hiện sau khi cache đã hết hạn.
6. **Giao nhiệm vụ đầu ra lớn cho Subagent:** Subagent chạy trong một cửa sổ ngữ cảnh độc lập, chỉ trả về kết luận cuối cùng, giữ cho quá trình trung gian (đọc file, chạy lệnh) không làm nặng hội thoại chính.
**Giải thích về chi phí Token:**
- **Token đầu vào (prefill)** được xử lý song song, rẻ hơn.
- **Token đầu ra (decode)** được tạo tuần tự, đắt hơn gấp **5 lần** token đầu ra.
- **Bộ nhớ đệm (Cache)** là công cụ tiết kiệm mạnh mẽ nhất: nếu phần đầu của yêu cầu hiện tại giống hệt lần trước, chi phí đọc lại chỉ bằng **10%** giá gốc. Tuy nhiên, cache dễ mất do thay đổi mô hình, effort level, hoặc hết thời gian timeout.
**Quản lý sự "phình to" của hội thoại:**
Mỗi file được đọc hay kết quả lệnh được thực thi đều được thêm vào lịch sử, khiến các lượt hội thoại sau phải gửi lại toàn bộ nội dung tích lũy trước đó, làm chi phí tăng theo cấp số nhân. Ngoài các mẹo trên, có thể dùng **/rewind** để cắt bỏ các lượt hội thoại đi lệch mà không làm hỏng cache.
**Kết luận:**
Việc quản lý hiệu quả token - từ chọn mô hình, bảo toàn cache đến kiểm soát độ dài ngữ cảnh - đang trở thành một kỹ năng thiết yếu của lập trình viên trong thời đại AI. Nó không chỉ giúp tiết kiệm chi phí (chênh lệch có thể lên tới 10 lần cho cùng một task), mà còn tối đa hóa giá trị làm việc với ngân sách có sẵn.
marsbit1 giờ trước