Programmer di Seluruh Dunia Terus Memberikan Uang Gratis ke Anthropic, Akhirnya Perusahaan Resmi Tidak Tahan Lagi

marsbitXuất bản vào 2026-08-17Cập nhật gần nhất vào 2026-08-17

Tóm tắt

Baru-baru ini, Anthropic menerbitkan panduan berisi enam tips utama untuk menghemat token saat menggunakan Claude Code: 1. **/clear setelah tugas selesai:** Hapus percakapan usai menyelesaikan satu tugas agar riwayat tidak membebani konteks berikutnya. 2. **Tetapkan model dan tingkat usaha (effort level) sejak awal:** Mengubahnya di tengah percakapan akan menghapus cache prompt, sehingga seluruh riwayat dihitung ulang dengan harga penuh. 3. **Gunakan @ untuk merujuk file, jangan ketik path secara manual:** Dengan melampirkan file langsung, Claude tidak perlu memanggil alat baca tambahan yang menambah token. 4. **Tambahkan parameter "quiet" pada perintah dengan output panjang:** Konfigurasi di CLAUDE.md (seperti `--reporter=dot`) mempersingkat output, mengurangi token konteks. 5. **Lakukan /compact sebelum istirahat:** Kompresi saat cache masih aktif hanya berbiaya 10% dibanding setelah cache kadaluarsa. 6. **Serahkan tugas output besar ke subagent:** Subagent berjalan di konteks terpisah, hanya mengembalikan kesimpulan, sehingga prosesnya tidak memenuhi percakapan utama. Token dihitung berdasarkan input (prefill) dan output (decode), dengan output 5x lebih mahal. Harga bervariasi menurut model (Opus, Sonnet, Haiku) dan tingkat usaha. **Cache prompt** adalah penghemat terbesar — jika prefix permintaan sama dengan sebelumnya, biaya input turun 90%. Namun, cache gagal jika ada perubahan model, effort level, mode cepat, /compact, waktu kadaluarsa, atau sesi lama yang dipulihkan...

Baru saja (tanggal 15), Anthropic memposting sebuah blog.

Inti informasinya adalah: Semuanya, berhentilah membakar token dengan sia-sia, kami sudah tidak tahan melihatnya!

Untuk itu, pihak resmi merinci enam cara menghemat uang, berikut ini:

1. /clear setelah tugas selesai. Setelah memperbaiki satu bug, kosongkan percakapan saat ini. Jangan biarkan file yang dibaca dan output perintah dari tugas sebelumnya terbawa ke tugas berikutnya, memakan konteks tanpa perlu.

2. Tentukan model dan level upaya (effort level) di awal. Jika beralih di tengah jalan, cache prompt yang terakumulasi sebelumnya akan hangus seluruhnya, dan seluruh riwayat percakapan harus dihitung ulang dengan harga penuh.

3. Gunakan @ untuk mereferensikan file, jangan ketik path secara manual. Gunakan @ untuk melampirkan file langsung ke pesan, Claude tidak perlu menghabiskan panggilan tool lagi untuk membacanya. Jika Anda hanya mengetik nama file, Claude mungkin akan mencari dulu, lalu membuka beberapa file untuk mencoba, semua operasi ini akan masuk ke riwayat percakapan dan dibawa di setiap putaran selanjutnya.

4. Tambahkan parameter senyap (quiet flag) pada perintah dengan output banyak. Tulis konfigurasi seperti --reporter=dot di CLAUDE.md, sehingga output pengujian hanya mencetak beberapa baris ringkasan, bukan ratusan baris detail. Semakin pendek output, semakin sedikit konteks yang digunakan.

5. Lakukan /compact sebelum istirahat. Kompresi saat percakapan masih ada di cache, biayanya hanya sepersepuluh dari normal. Jika Anda melakukannya setelah cache kedaluwarsa saat kembali, harus membaca ulang dengan harga penuh baru kemudian mengompres.

6. Serahkan tugas dengan output besar ke Sub-Agent. Sub-Agent berjalan di jendela konteks yang terpisah, setelah selesai hanya kesimpulan yang dikirim kembali. File yang dibaca dan output perintah yang dijalankan selama proses tidak akan masuk ke percakapan utama Anda.

Kehidupan Sebelum dan Sesudah Satu Token

Bekerja dengan Claude Code, API dibayar berdasarkan penggunaan, biaya langganan bulanan dibagi menjadi tiga tingkat dari $20 hingga $200.

Menurut perkiraan resmi, pengembang rata-rata menghabiskan $13 token per hari, dengan pengeluaran bulanan antara $150 hingga $250.

Ini baru rata-rata. Memperbaiki bug yang sama, cara bertanya yang berbeda bisa menghasilkan biaya beberapa kali lipat.

Dan setiap putaran percakapan mengirim ulang semua konten dari semua putaran sebelumnya, semakin panjang sesi, semakin mahal setiap putaran.

Uang ini dihabiskan di mana? Mari kita mulai dari logika penetapan harga token.

Setiap kali Anda memasukkan instruksi di Claude Code, dua hal terjadi di balik layar.

Pertama disebut prefill, yaitu model membaca seluruh permintaan Anda sekaligus, termasuk prompt sistem, CLAUDE.md, pesan Anda, serta semua yang terakumulasi dalam percakapan sebelumnya. Ini adalah token input.

Kedua disebut decode, yaitu proses model menulis keluar kata demi kata, termasuk pemikirannya, panggilan tool, dan teks yang akhirnya Anda lihat. Ini adalah token output.

Perbedaan kuncinya di sini.

Prefill bersifat paralel, memproses semua token input melalui GPU sekaligus. Decode bersifat serial, setiap kali mengeluarkan satu token harus menjalankan model sekali. Balasan 200 token adalah 200 kali komputasi independen.

Jadi tidak sulit dipahami mengapa token output 5 kali lebih mahal daripada token input.

Atas dasar ini, tagihan akhir bergantung pada dua hal.

Pertama adalah model, menentukan harga per token.

Opus 5, input $5/juta token, output $25.

Sonnet 5, input $2, output $10.

Haiku 4.5, input $1, output $5.

Kedua adalah tingkat upaya (effort level), menentukan jumlah token.

Sebagian besar token output dalam satu sesi adalah token pemikiran, tingkat upaya mengontrol jumlah ini. Semakin tinggi tingkat upaya, model berpikir lebih lama, output token pemikiran lebih banyak. Antara max dan low bisa berbeda beberapa kali lipat.

Gunakan Sonnet untuk tugas sederhana, baru pakai Opus untuk yang sulit. Uang yang dihabiskan untuk membunuh lalat dengan kapak besar paling sia-sia.

Prompt Cache, Senjata Penghemat Terbesar

Ada variabel besar lain dalam penetapan harga token, yaitu cache.

Setiap permintaan Claude Code dimulai dari awalan yang sama, yaitu prompt sistem, definisi tool, CLAUDE.md, dan riwayat percakapan.

Jika awalan permintaan kali ini persis sama byte demi byte dengan yang terakhir, server tidak menghitung ulang, langsung memuat hasil komputasi terakhir.

Membaca cache hanya membutuhkan 0.1 kali harga input normal, langsung menghemat 90%.

Menulis cache sedikit lebih mahal, maksimal 2 kali. Tetapi penulisan hanya terjadi sekali, setiap putaran selanjutnya menikmati pembacaan 0.1 kali.

Sebagai contoh.

Misalkan riwayat percakapan Anda memiliki 50 ribu token. Tanpa cache, setiap putaran hanya untuk membaca ulang 50 ribu token ini harus membayar harga penuh. Tetapi jika mengenai cache, 50 ribu token yang sama hanya membutuhkan sepersepuluh biaya.

Satu sesi berjalan dua puluh tiga puluh putaran, diskon yang terkumpul dari hit cache adalah jumlah yang luar biasa.

Ini adalah leverage 'merumput' terbesar Anda.

Tetapi cache memiliki kelemahan fatal. Cache harus cocok secara berurutan dari byte pertama permintaan, perubahan di mana pun di tengah, semua setelahnya menjadi tidak berlaku.

Secara spesifik, ada enam situasi:

1. /model mengganti model: Cache setiap model independen. Beralih dari Sonnet ke Opus, seluruh riwayat percakapan di-prefill ulang dengan harga Opus, tanpa diskon.

2. /effort mengganti tingkat upaya: Tingkat upaya juga bagian dari kunci cache, setelah beralih seluruh riwayat percakapan harus dihitung ulang.

3. Menyalakan/mematikan Fast mode: Efeknya sama dengan dua jenis sebelumnya, cache langsung tidak berlaku.

4. /compact mengompresi percakapan: Percakapan ditulis ulang menjadi ringkasan, konten asli tidak cocok sama sekali, cache lama langsung tidak berlaku.

5. Waktu kedaluwarsa: Cache pengguna langganan bertahan 1 jam, pengguna API default 5 menit. Setelah waktu habis, putaran berikutnya dihitung ulang secara penuh.

6. Memulihkan sesi lama: Terlalu lama terpisah, cache sudah lama hilang, hampir 100% harus dihitung ulang dengan harga penuh.

Berita buruknya, sekali terkena berarti seluruh riwayat percakapan dari 0.1 kali kembali ke harga asli.

Berita baiknya, ketika Anda tahu apa yang membuat cache tidak berlaku, Anda bisa tahu cara menjaganya.

Misalnya, kunci model dan tingkat upaya di awal sesi, jangan beralih selama sesi. Jangan melakukan /compact saat cache masih panas, lakukan saat akan istirahat.

Di sini, ada jebakan tersembunyi.

Mode opusplan setiap kali masuk/keluar plan mengganti model. Masuk sekali, cache tidak berlaku sekali. Keluar, tidak berlaku lagi. Jika bolak-balik, setiap lompatan adalah satu prefill dengan harga penuh.

Sesi Anda, Diam-diam Menjadi Gemuk

Cache membantu Anda menekan biaya mengirim ulang riwayat menjadi sepersepuluh.

Tapi ada satu hal yang tidak bisa dibantunya. Riwayat Anda sendiri membesar putaran demi putaran.

Setiap kali Claude membaca sebuah file, konten file ditambahkan ke percakapan. Setiap kali Claude menjalankan perintah, output juga ditambahkan. Dari putaran penambahan itu, setiap putaran berikutnya membawanya.

Percakapan putaran ke-40 mengirim ulang semua konten terakumulasi dari putaran 1 hingga 39.

Pertumbuhan seperti ini mendekati tingkat O(n2) kuadrat.

Claude Code memiliki mekanisme cadangan.

Jika output perintah melebihi 30000 karakter, tidak dimasukkan ke percakapan, tetapi ditulis ke file sementara, percakapan hanya berisi satu kalimat ringkasan. Tapi output di bawah 30000 tidak diurus.

Misalnya, framework pengujian selesai dijalankan, mencetak 400 baris catatan lulus, setiap baris puluhan karakter, total kurang dari 3 ribu, tidak mencapai ambang batas ini.

Maka 400 baris ini tetap berada di riwayat percakapan, setiap putaran berikutnya dibawa mengirim ulang.

Untuk ini, blog Anthropic memberikan beberapa cara praktis untuk melangsingkan.

1. @ referensikan file.

Jangan masukkan path secara manual untuk Claude cari sendiri. Referensi @ akan melampirkan file langsung ke pesan, menghemat satu operasi membaca.

Jika Anda hanya menyebut nama file, Claude mungkin akan grep mencari dulu, membuka beberapa file untuk melihat mana yang benar. Kemudian semua percobaan ini akan masuk ke riwayat percakapan, hanya menambah biaya.

2. Tambahkan quiet flag pada perintah yang berisik (noisy).

Tulis di CLAUDE.md "jalankan tes dengan npx vitest run --reporter=dot", sehingga setiap kali menjalankan tes hanya mengeluarkan beberapa baris hasil titik, bukan ratusan baris detail. Konfigurasi satu menit, menghemat ratusan baris konteks setiap sesi nanti.

3. Isolasi tugas output besar dengan subagent.

Subagent berjalan di jendela konteksnya sendiri yang terpisah, setelah selesai hanya mengirimkan jawaban kembali, file yang dibaca dan output perintah selama proses semuanya dibuang. Cocok untuk tugas seperti "lihat log apa ada yang aneh" atau "bantu saya tinjau file besar ini". Anda hanya butuh kesimpulan, bukan prosesnya.

Dan yang paling penting satu lagi.

4. /clear untuk mengganti tugas.

Setelah memperbaiki satu bug, /clear, mulai hal berikutnya. File, output perintah, eksplorasi tengah dari bug sebelumnya, semua tidak relevan dengan tugas berikutnya, tetapi jika tidak dibersihkan, mereka akan menempati posisi dan memakan token di setiap putaran berikutnya.

Jika tidak ingin mengosongkan sepenuhnya, /compact bisa mengompresi percakapan menjadi ringkasan. Sepuluh hingga dua puluh ribu token bisa dikompres menjadi seribu hingga tiga ribu.

Selain itu, blog juga menyebutkan operasi yang tidak populer tetapi gratis, /rewind.

Jika beberapa putaran terakhir melenceng, /rewind langsung memotong putaran-putaran itu, cache sebelumnya tidak terganggu sama sekali.

Mengelola Token, Juga Merupakan Kecakapan Pengembang

Setelah mengurai semua operasi di atas, Anda akan menemukan suatu pola. Orang yang menulis kode sedang mengembangkan seperangkat keterampilan baru.

Tidak terkait dengan framework atau bahasa, tetapi mengetahui model apa yang harus dipilih, bagaimana mengelola konteks, bagaimana menjaga cache, tingkat upaya berapa yang sesuai.

Kemampuan ini tidak ada setahun yang lalu. Tetapi sekarang menentukan apakah Anda menghabiskan $3 atau $30 untuk tugas yang sama.

Anthropic sendiri adalah contoh terbaik.

80% kode mereka ditulis oleh AI, jumlah penggabungan kode meningkat 8 kali lipat dalam setahun, pengujian benchmark dipercepat 52 kali lipat. Menggunakan AI dengan intensitas seperti ini, jika tidak ada yang mengelola token, biaya inferensi saja bisa menghabiskan anggaran.

Dari sudut pandang ini, daripada mengatakan blog ini membahas trik menghemat uang, lebih tepat dikatakan sebagai naluri baru yang perlu dimiliki orang yang menulis kode di era AI —

Mengetahui setiap operasi Anda mengonsumsi apa, mengetahui bagaimana membuat anggaran yang sama melakukan lebih banyak pekerjaan.

Orang yang membacanya dengan paham, merumput bukan hanya beberapa dolar token.

Referensi:

https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions

Artikel ini berasal dari akun WeChat publik "Xin Zhi Yuan", penulis: Mosi

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QApa 6 teknik penghematan token yang direkomendasikan Anthropic dalam blog mereka?

A1. Gunakan /clear setelah menyelesaikan tugas. 2. Tentukan model dan tingkat usaha di awal sesi. 3. Gunakan @ untuk merujuk file, jangan ketik path manual. 4. Tambahkan flag 'quiet' pada perintah yang menghasilkan output banyak. 5. Lakukan /compact sebelum istirahat saat cache masih aktif. 6. Gunakan subagent untuk tugas dengan output besar.

QMengapa token output lebih mahal daripada token input dalam Claude Code?

AToken output lebih mahal karena proses decoding berjalan secara serial, mengharuskan model dijalankan untuk setiap token yang dihasilkan. Sedangkan token input diproses secara paralel dalam sekali jalan (prefill).

QApa itu 'prompt caching' dan bagaimana cara kerjanya menghemat biaya?

APrompt caching adalah penyimpanan hasil komputasi untuk bagian awal permintaan yang sama (seperti petunjuk sistem, riwayat percakapan). Jika permintaan berikutnya memiliki awal yang identik, server memuat hasil cache dengan biaya hanya 10% dari harga input normal, menghemat 90%.

QApa saja tindakan yang menyebabkan cache prompt menjadi tidak valid (cache invalidation)?

A1. Mengganti model dengan /model. 2. Mengubah tingkat usaha (effort level). 3. Menghidupkan/mematikan Fast mode. 4. Melakukan kompresi percakapan (/compact). 5. Cache kedaluwarsa (1 jam untuk pelanggan berlangganan, 5 menit untuk API). 6. Membuka sesi lama yang cache-nya sudah hilang.

QApa fungsi perintah /rewind yang disebutkan dalam artikel dan keuntungannya?

APerintah /rewind memungkinkan pengguna menghapus beberapa putaran percakapan terakhir yang keluar jalur. Keuntungannya adalah cache dari percakapan sebelumnya tetap utuh dan tidak perlu dihitung ulang, sehingga menghemat biaya token.

Nội dung Liên quan

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

Nền tảng truyền thông xã hội X của Elon Musk đang xem xét khả năng sử dụng stablecoin để trả thưởng cho những người sáng tạo nội dung. Theo nguồn tin, X đang đàm phán về việc sử dụng stablecoin, chủ yếu là USDC, cho các khoản thanh toán này. Kế hoạch hiện vẫn đang được thảo luận và chưa có quyết định cuối cùng hay thời điểm triển khai cụ thể. Nếu được thực hiện, nó có thể cho phép các nhà sáng tạo nội dung trên toàn cầu nhận tiền nhanh hơn dưới dạng kỹ thuật số. Các chuyên gia nhận định việc sử dụng stablecoin, đặc biệt trong thanh toán xuyên biên giới, có thể trở thành một giải pháp thay thế cho các hệ thống thanh toán truyền thống. Bài báo cũng đề cập rằng SpaceX, một công ty khác của Elon Musk, đã sử dụng stablecoin để thực hiện các khoản thanh toán xuyên biên giới cho dịch vụ Starlink ở một số quốc gia. Mặc dù chưa được phê duyệt, việc X cân nhắc sử dụng các đồng tiền kỹ thuật số như USDC được coi là một tín hiệu mới về khả năng mở rộng ứng dụng của stablecoin vào các giao dịch thanh toán kỹ thuật số hàng ngày.

cryptonews.ru2 giờ trước

Elon Musk và Công ty X Tiến Thêm Bước Về Tiền Mã Hóa! Một Kỷ Nguyên Thanh Toán Mới Đang Ló Dạng! Đây Là Chi Tiết

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

Nhà đầu tư tiền điện tử mất 1.010 ETH do truy cập trang web Tornado Cash lỗi thời bị chiếm đoạt. Các nhà phân tích từ Wu Blockchain cho biết nạn nhân đã sử dụng dấu trang trình duyệt cũ để vào trang trộn tiền điện tử, lúc này tên miền đã bị kẻ xấu kiểm soát và triển khai giao diện giả mạo. Tin rằng mình đang tương tác với hợp đồng thông minh Tornado Cash thật, nạn nhân đã cấp quyền truy cập tài sản cho bọn lừa đảo, và số tiền bị rút sạch trong vòng 12 giờ. Số tiền bị đánh cắp, hiện nằm rải rác trên nhiều địa chỉ ví do tội phạm kiểm soát, được rút thành nhiều lần nhỏ. Nhóm Tornado Cash đã mất quyền kiểm soát tên miền cũ sau lệnh trừng phạt của OFAC Mỹ năm 2022, và kể từ đó, bọn tội phạm đã đăng ký lại và vận hành trang web lừa đảo. Trong 12 tháng qua, trang web giả này được cho là đã đánh cắp tổng cộng khoảng 4.000 ETH từ nhiều người dùng. Trong bối cảnh này, các chuyên gia bảo mật Bitdefender cũng cảnh báo về phần mềm độc hại Lumma Stealer đang được phát tán dưới vỏ bọc là bản phim lậu của bộ phim "Oppenheimer" đạo diễn bởi Christopher Nolan.

cryptonews.ru2 giờ trước

Nhà đầu tư tiền điện tử mất 1010 ETH do truy cập trang web Tornado Cash lỗi thời

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

Các nhà phân tích cho biết Quy định về Thị trường Tài sản Crypto (MiCA) của châu Âu chưa gây ra hiện tượng rút tiền hàng loạt trên toàn cầu khỏi stablecoin USDT. Dữ liệu từ Artemis Analytics và một nghiên cứu độc lập của Đại học LUISS và Đại học Surrey chỉ ra rằng việc hạn chế USDT trên các sàn giao dịch được quản lý ở châu Âu chưa dẫn đến sự sụt giảm đáng kể về nguồn cung hoặc nhu cầu toàn cầu đối với USDT. Nghiên cứu xác nhận MiCA đã thay đổi cơ cấu giao dịch trên một số nền tảng cụ thể ở châu Âu, nơi thị phần của USDC đã tăng lên sau khi USDT bị hạn chế. Tuy nhiên, thị phần và khối lượng giao dịch tổng hợp của các stablecoin hàng đầu hầu như không thay đổi trên quy mô toàn cầu. USDT vẫn giữ vị trí dẫn đầu với vốn hóa thị trường khoảng 183 tỷ USD vào cuối tháng 7. Hoạt động với USDT tiếp tục mở rộng mạnh mẽ bên ngoài châu Âu, đặc biệt trên các mạng như BNB Chain và Tron, phản ánh xu hướng áp dụng số hóa đô la trên các thị trường mới nổi. Trong khi đó, tại châu Âu, việc Tether không đăng ký theo MiCA đã khiến nhiều dịch vụ phải hạn chế USDT. Dù vậy, dữ liệu không cho thấy sự dịch chuyển thanh khoản quy mô lớn hoặc thay đổi đột ngột trùng khớp với thời điểm MiCA có hiệu lực.

cryptonews.ru2 giờ trước

Các chuyên gia phân tích: MiCA chưa gây ra đợt rút vốn toàn cầu đáng kể khỏi USDT

cryptonews.ru2 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua CORE

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua CORE (CORE) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua CORE (CORE) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ CORE (CORE) của BạnSau khi mua CORE (CORE), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch CORE (CORE)Giao dịch CORE (CORE) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 630Xuất bản vào 2024.12.13Cập nhật vào 2026.06.02

Làm thế nào để Mua CORE

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của CORE (CORE) được trình bày dưới đây.

活动图片