
Baru saja, Anthropic memposting sebuah blog.
Informasi intinya adalah: Semuanya, hentikan pembakaran token sia-sia, kami sudah tidak tahan melihatnya!

Untuk itu, resmi mendaftarkan enam pedoman penghematan biaya, berikut ini:
1. /clear setelah tugas selesai. Setelah memperbaiki satu bug, kosongkan percakapan saat ini. Jangan biarkan file yang dibaca dan output perintah dari tugas sebelumnya terbawa ke tugas berikutnya, hanya memenuhi konteks percakapan.
2. Tentukan model dan tingkat upaya (effort level) sejak awal. Jika beralih di tengah jalan, semua cache prompt yang terkumpul akan hangus, seluruh riwayat percakapan harus dihitung ulang dengan harga penuh.
3. Gunakan @ untuk mereferensikan file, jangan ketik path secara manual. Gunakan @ untuk melampirkan file langsung ke pesan, Claude tidak perlu lagi menghabiskan satu panggilan alat untuk membacanya. Jika Anda hanya mengetik nama file, Claude mungkin akan mencari dulu, lalu membuka beberapa file untuk menguji, semua operasi ini akan masuk ke riwayat percakapan dan terbawa di setiap putaran berikutnya.
4. Tambahkan parameter senyap (quiet flag) pada perintah dengan output banyak. Tulis konfigurasi seperti --reporter=dot di CLAUDE.md, sehingga output pengujian hanya mencetak beberapa baris ringkasan, bukan ratusan baris detail. Output yang lebih pendek, konteks yang lebih sedikit terpakai.
5. Lakukan /compact sebelum istirahat. Kompres percakapan saat masih dalam cache, biayanya hanya sepersepuluh dari biasanya. Jika Anda melakukannya setelah cache kedaluwarsa saat kembali, harus dibaca ulang dan dikompres dengan harga penuh.
6. Tugas output besar serahkan ke Sub-Agent. Sub-Agent berjalan di jendela konteks yang independen, hanya mengembalikan kesimpulan setelah selesai. File yang dibaca dan output perintah yang dijalankan selama proses tidak akan masuk ke percakapan utama Anda.

Kehidupan Token dari Awal hingga Akhir
Menggunakan Claude Code untuk bekerja, API ditagih berdasarkan volume, biaya langganan bulanan dibagi menjadi tiga tingkat dari $20 hingga $200.
Menurut perkiraan resmi, pengembang rata-rata menghabiskan $13 token per hari, dengan pengeluaran bulanan antara $150 hingga $250.
Ini hanya rata-rata. Memperbaiki bug yang sama, cara bertanya yang berbeda, biayanya bisa berbeda berkali-kali lipat.
Dan setiap putaran percakapan mengirim ulang semua konten dari semua putaran sebelumnya. Semakin lama sesi, semakin mahal setiap putarannya.
Uang ini dibelanjakan di mana, harus dimulai dari logika penetapan harga token.

Setiap kali Anda memasukkan perintah di Claude Code, dua hal terjadi di belakang layar.
Pertama disebut pra-pengisian (prefill), yaitu model membaca seluruh permintaan Anda sekaligus, termasuk prompt sistem, CLAUDE.md, pesan Anda, dan semua yang terkumpul dalam percakapan sebelumnya. Semua ini adalah token input.
Kedua disebut dekode (decode), yaitu proses model menulis kata demi kata, termasuk pemikirannya, panggilan alat, dan teks yang akhirnya Anda lihat. Semua ini adalah token output.
Perbedaan kuncinya di sini.
Pra-pengisian dilakukan secara paralel, semua token input diproses GPU sekali jalan. Dekode dilakukan secara serial, setiap token yang dikeluarkan harus menjalankan model sekali. Balasan 200 token berarti 200 kali komputasi independen.
Jadi tidak sulit dipahami, mengapa token output 5 kali lebih mahal daripada token input.

Dasar ini, tagihan akhir bergantung pada dua hal.
Pertama adalah model, menentukan harga per token.
Opus 5, input $5/juta token, output $25.
Sonnet 5, input $2, output $10.
Haiku 4.5, input $1, output $5.
Kedua adalah tingkat upaya (effort level), menentukan jumlah token.
Sebagian besar token output dalam sesi adalah token pemikiran (thinking tokens), tingkat upaya mengontrol jumlah ini. Semakin tinggi tingkat upaya, semakin lama model berpikir, semakin banyak token pemikiran yang dihasilkan. Perbedaan antara 'max' dan 'low' bisa berkali-kali lipat.
Gunakan Sonnet untuk pekerjaan sederhana, pakai Opus untuk masalah sulit. Uang yang dihabiskan untuk membunuh nyamuk dengan meriam, paling sia-sia.

Cache Prompt, adalah Senjata Penghemat Terbesar
Ada variabel besar lain dalam penetapan harga token, yaitu cache.
Setiap permintaan Claude Code dimulai dari awalan yang sama, yaitu prompt sistem, definisi alat, CLAUDE.md, dan riwayat percakapan.
Jika awalan permintaan kali ini persis sama byte demi byte dengan yang terakhir, server tidak menghitung ulang, langsung memuat hasil perhitungan terakhir.
Pembacaan cache hanya 0.1 kali harga input normal, langsung menghemat 90%.
Penulisan cache sedikit lebih mahal, maksimal 2 kali. Tapi penulisan hanya terjadi sekali, setiap putaran berikutnya menikmati pembacaan 0.1 kali.
Sebagai contoh.
Misalkan riwayat percakapan Anda memiliki 50 ribu token. Tanpa cache, setiap putaran hanya untuk membaca ulang 50 ribu token ini harus membayar harga penuh. Tapi jika cache terhantam, 50 ribu token yang sama hanya membutuhkan sepersepuluh biaya.
Sesi berjalan 20-30 putaran, diskon yang terkumpul dari hit cache adalah angka yang sangat besar.
Ini adalah leverage terbesar Anda untuk menghemat.

Tapi cache memiliki kelemahan fatal. Itu harus cocok secara berurutan dari byte pertama permintaan, setiap perubahan di tengah, dari sana ke belakang semuanya hangus.
Secara spesifik, ada enam situasi:
1. /model ganti model: Cache setiap model independen. Beralih dari Sonnet ke Opus, seluruh riwayat percakapan di-prefill ulang dengan harga Opus, tanpa diskon.
2. /effort ganti tingkat upaya: Tingkat upaya juga bagian dari kunci cache, setelah berganti seluruh riwayat percakapan harus dihitung ulang.
3. Aktif/nonaktifkan Fast mode: Efeknya sama dengan dua jenis sebelumnya, cache langsung hangus.
4. /compact kompres percakapan: Percakapan ditulis ulang menjadi ringkasan, konten asli tidak cocok lagi, cache lama langsung hangus.
5. Waktu kedaluwarsa: Cache pengguna langganan aktif selama 1 jam, pengguna API default 5 menit. Setelah waktu habis, putaran berikutnya dihitung ulang secara penuh.
6. Pulihkan sesi lama: Terlalu lama terpisah, cache sudah lama hilang, hampir 100% harus dihitung ulang dengan harga penuh.
Berita buruknya, terkena satu saja berarti seluruh riwayat percakapan dari 0.1x kembali ke harga asli.
Berita baiknya, saat Anda tahu apa yang membuat cache hangus, Anda tahu cara menjaganya.
Misalnya, kunci model dan tingkat upaya di awal sesi, jangan ganti selama sesi. Jangan lakukan /compact saat cache masih hangat, lakukan saat bersiap istirahat.
Di sini, ada jebakan tersembunyi lain.
Mode opusplan setiap kali masuk dan keluar plan mengganti model. Masuk sekali, cache hangus sekali. Keluar, hangus lagi. Bolak-balik, setiap lompatan adalah satu prefill harga penuh.
Percakapan Anda, Diam-diam Semakin Gemuk
Cache membantu Anda menekan biaya mengirim ulang riwayat menjadi sepersepuluh.
Tapi ada satu hal yang tidak bisa dibantu. Riwayat Anda sendiri berkembang dari putaran ke putaran.
Setiap kali Claude membaca file, konten file ditambahkan ke percakapan. Setiap kali Claude menjalankan perintah, output juga ditambahkan. Dari putaran itu, setiap putaran berikutnya membawanya.
Percakapan putaran ke-40 mengirim ulang semua konten terkumulasi dari putaran 1 hingga 39.
Pertumbuhan ini mendekati tingkat kuadrat O(n2).

CClaude Code memiliki mekanisme cadangan.
Jika output perintah melebihi 30.000 karakter, tidak dimasukkan ke percakapan, tetapi ditulis ke file sementara, percakapan hanya berisi satu kalimat ringkasan. Tapi output di bawah 30.000 tidak dikelola.
Misalnya, setelah framework pengujian selesai berjalan, mencetak 400 baris catatan lolos, setiap baris puluhan karakter, total kurang dari 30.000, tidak mencapai ambang batas ini.
Jadi 400 baris ini tetap utuh di riwayat percakapan, setiap putaran berikutnya ikut dikirim ulang.
Untuk ini, blog Anthropic memberikan beberapa metode praktis untuk mengecilkan riwayat.
1. @ mereferensikan file.
Jangan memasukkan path secara manual untuk Claude cari sendiri. Referensi @ akan melampirkan file langsung ke pesan, menghemat satu operasi pembacaan.
Jika Anda hanya menyebutkan nama file, Claude mungkin mencari dengan grep dulu, membuka beberapa file untuk melihat mana yang benar. Kemudian semua percobaan ini akan masuk ke riwayat percakapan, hanya menambah biaya.

2. Tambahkan quiet flag ke perintah berisik.
Tulis di CLAUDE.md "run tests with npx vitest run --reporter=dot", sehingga setiap kali menjalankan pengujian hanya mengeluarkan beberapa baris hasil titik, bukan ratusan baris detail. Satu menit konfigurasi, menghemat ratusan baris konteks setiap sesi.
3. Subagent mengisolasi tugas output besar.
Subagent berjalan di jendela konteks independennya sendiri, hanya mengembalikan jawaban setelah selesai, file yang dibaca dan output perintah selama proses semuanya dibuang. Cocok untuk pekerjaan seperti "lihat log apa ada anomali" atau "baca file besar ini untuk saya". Anda hanya perlu kesimpulan, bukan prosesnya.

Dan yang paling penting.
4. /clear untuk ganti tugas.
Setelah memperbaiki satu bug, /clear, mulai hal berikutnya. File, output perintah, eksplorasi tengah dari bug sebelumnya, semuanya tidak relevan dengan tugas berikutnya. Tapi jika tidak dibersihkan, mereka menempati posisi, memakan token di setiap putaran berikutnya.
Jika tidak ingin benar-benar mengosongkan, /compact dapat mengecilkan percakapan menjadi ringkasan. Sepuluh hingga dua puluh ribu token dapat dikecilkan menjadi seribu hingga tiga ribu.

Selain itu, blog juga menyebutkan operasi yang kurang dikenal tapi gratis, /rewind.
Jika beberapa putaran terakhir melenceng, /rewind langsung memotong putaran-putaran itu, cache sebelumnya benar-benar tidak terganggu.

Mengelola Token, Juga Adalah Keterampilan Developer
Setelah membongkar semua operasi di atas, Anda akan menemukan pola. Orang yang menulis kode sedang mengembangkan seperangkat keterampilan baru.
Tidak ada hubungannya dengan framework atau bahasa, tetapi tahu model apa yang harus dipilih, bagaimana mengelola konteks, bagaimana menjaga cache, tingkat upaya yang tepat.
Kemampuan ini tidak ada setahun yang lalu. Tapi sekarang menentukan apakah Anda menghabiskan $3 atau $30 untuk tugas yang sama.
Anthropic sendiri adalah contoh terbaik.
80% kode mereka ditulis oleh AI, volume penggabungan kode meningkat 8 kali lipat dalam setahun, pengujian benchmark dipercepat 52 kali lipat. Dengan intensitas penggunaan AI seperti ini, jika tidak ada yang mengelola token, biaya inferensi saja bisa menghabiskan anggaran.
Dari sudut pandang ini, daripada mengatakan blog ini berbicara tentang trik penghematan biaya, lebih baik mengatakan itu adalah naluri baru yang perlu dimiliki orang yang menulis kode di era AI—
Mengetahui apa yang dikonsumsi setiap operasi Anda, mengetahui bagaimana membuat anggaran yang sama menghasilkan lebih banyak pekerjaan.
Orang yang memahaminya, menghemat bukan hanya beberapa dolar token.
Referensi:
https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions
Editor: Moses
Artikel ini berasal dari akun WeChat resmi "Xinzhiyuan", penulis: ASI Revelations





