Programmer di Seluruh Dunia Memberikan Uang Gratis ke Anthropic! Akhirnya Resmi Turun Tangan

marsbitDipublikasikan tanggal 2026-08-16Terakhir diperbarui pada 2026-08-16

Abstrak

Anthropic merilis blog resmi berisi enam tips untuk menghemat biaya token saat menggunakan Claude Code. Intinya, mereka menyarankan: 1) Bersihkan percakapan (/clear) setelah satu tugas selesai; 2) Tentukan model dan tingkat usaha (/effort) di awal, karena mengubahnya akan menghapus cache dan membuat sejarah percakapan dihitung ulang dengan harga penuh; 3) Gunakan @ untuk menyertakan file langsung, ketimbang mengetikkan path; 4) Tambahkan parameter "quiet" pada perintah yang output-nya panjang agar tidak memenuhi konteks; 5) Lakukan kompresi (/compact) saat cache masih hangat (sebelum istirahat) agar biayanya hanya 10%; 6) Gunakan subagent untuk tugas dengan output besar agar prosesnya terisolasi. Biaya token dipengaruhi oleh model (Opus, Sonnet, Haiku) dan jumlah token. Output token 5x lebih mahal daripada input token karena proses dekodenya yang serial. Kunci penghematan terbesar adalah **prompt caching**: jika prefix permintaan sama dengan sebelumnya, biaya baca cache hanya 0.1x harga normal. Namun, cache bisa gagal jika ada perubahan model, tingkat usaha, mode cepat, kompresi, waktu kedaluwarsa, atau membuka sesi lama. Sejarah percakapan juga bisa membengkak (O(n²)) karena file dan output perintah yang dibaca/dijalankan Claude terus menumpuk. Tips lain: gunakan /rewind untuk membatalkan percakapan yang melenceng tanpa menghapus cache sebelumnya. Mengelola token dengan cerdas kini menjadi keterampilan penting bagi developer di era AI untuk bekerja lebih efisien dengan ang...

Baru saja, Anthropic memposting sebuah blog.

Informasi intinya adalah: Semuanya, hentikan pembakaran token sia-sia, kami sudah tidak tahan melihatnya!

Untuk itu, resmi mendaftarkan enam pedoman penghematan biaya, berikut ini:

1. /clear setelah tugas selesai. Setelah memperbaiki satu bug, kosongkan percakapan saat ini. Jangan biarkan file yang dibaca dan output perintah dari tugas sebelumnya terbawa ke tugas berikutnya, hanya memenuhi konteks percakapan.

2. Tentukan model dan tingkat upaya (effort level) sejak awal. Jika beralih di tengah jalan, semua cache prompt yang terkumpul akan hangus, seluruh riwayat percakapan harus dihitung ulang dengan harga penuh.

3. Gunakan @ untuk mereferensikan file, jangan ketik path secara manual. Gunakan @ untuk melampirkan file langsung ke pesan, Claude tidak perlu lagi menghabiskan satu panggilan alat untuk membacanya. Jika Anda hanya mengetik nama file, Claude mungkin akan mencari dulu, lalu membuka beberapa file untuk menguji, semua operasi ini akan masuk ke riwayat percakapan dan terbawa di setiap putaran berikutnya.

4. Tambahkan parameter senyap (quiet flag) pada perintah dengan output banyak. Tulis konfigurasi seperti --reporter=dot di CLAUDE.md, sehingga output pengujian hanya mencetak beberapa baris ringkasan, bukan ratusan baris detail. Output yang lebih pendek, konteks yang lebih sedikit terpakai.

5. Lakukan /compact sebelum istirahat. Kompres percakapan saat masih dalam cache, biayanya hanya sepersepuluh dari biasanya. Jika Anda melakukannya setelah cache kedaluwarsa saat kembali, harus dibaca ulang dan dikompres dengan harga penuh.

6. Tugas output besar serahkan ke Sub-Agent. Sub-Agent berjalan di jendela konteks yang independen, hanya mengembalikan kesimpulan setelah selesai. File yang dibaca dan output perintah yang dijalankan selama proses tidak akan masuk ke percakapan utama Anda.

Kehidupan Token dari Awal hingga Akhir

Menggunakan Claude Code untuk bekerja, API ditagih berdasarkan volume, biaya langganan bulanan dibagi menjadi tiga tingkat dari $20 hingga $200.

Menurut perkiraan resmi, pengembang rata-rata menghabiskan $13 token per hari, dengan pengeluaran bulanan antara $150 hingga $250.

Ini hanya rata-rata. Memperbaiki bug yang sama, cara bertanya yang berbeda, biayanya bisa berbeda berkali-kali lipat.

Dan setiap putaran percakapan mengirim ulang semua konten dari semua putaran sebelumnya. Semakin lama sesi, semakin mahal setiap putarannya.

Uang ini dibelanjakan di mana, harus dimulai dari logika penetapan harga token.

Setiap kali Anda memasukkan perintah di Claude Code, dua hal terjadi di belakang layar.

Pertama disebut pra-pengisian (prefill), yaitu model membaca seluruh permintaan Anda sekaligus, termasuk prompt sistem, CLAUDE.md, pesan Anda, dan semua yang terkumpul dalam percakapan sebelumnya. Semua ini adalah token input.

Kedua disebut dekode (decode), yaitu proses model menulis kata demi kata, termasuk pemikirannya, panggilan alat, dan teks yang akhirnya Anda lihat. Semua ini adalah token output.

Perbedaan kuncinya di sini.

Pra-pengisian dilakukan secara paralel, semua token input diproses GPU sekali jalan. Dekode dilakukan secara serial, setiap token yang dikeluarkan harus menjalankan model sekali. Balasan 200 token berarti 200 kali komputasi independen.

Jadi tidak sulit dipahami, mengapa token output 5 kali lebih mahal daripada token input.

Dasar ini, tagihan akhir bergantung pada dua hal.

Pertama adalah model, menentukan harga per token.

Opus 5, input $5/juta token, output $25.

Sonnet 5, input $2, output $10.

Haiku 4.5, input $1, output $5.

Kedua adalah tingkat upaya (effort level), menentukan jumlah token.

Sebagian besar token output dalam sesi adalah token pemikiran (thinking tokens), tingkat upaya mengontrol jumlah ini. Semakin tinggi tingkat upaya, semakin lama model berpikir, semakin banyak token pemikiran yang dihasilkan. Perbedaan antara 'max' dan 'low' bisa berkali-kali lipat.

Gunakan Sonnet untuk pekerjaan sederhana, pakai Opus untuk masalah sulit. Uang yang dihabiskan untuk membunuh nyamuk dengan meriam, paling sia-sia.

Cache Prompt, adalah Senjata Penghemat Terbesar

Ada variabel besar lain dalam penetapan harga token, yaitu cache.

Setiap permintaan Claude Code dimulai dari awalan yang sama, yaitu prompt sistem, definisi alat, CLAUDE.md, dan riwayat percakapan.

Jika awalan permintaan kali ini persis sama byte demi byte dengan yang terakhir, server tidak menghitung ulang, langsung memuat hasil perhitungan terakhir.

Pembacaan cache hanya 0.1 kali harga input normal, langsung menghemat 90%.

Penulisan cache sedikit lebih mahal, maksimal 2 kali. Tapi penulisan hanya terjadi sekali, setiap putaran berikutnya menikmati pembacaan 0.1 kali.

Sebagai contoh.

Misalkan riwayat percakapan Anda memiliki 50 ribu token. Tanpa cache, setiap putaran hanya untuk membaca ulang 50 ribu token ini harus membayar harga penuh. Tapi jika cache terhantam, 50 ribu token yang sama hanya membutuhkan sepersepuluh biaya.

Sesi berjalan 20-30 putaran, diskon yang terkumpul dari hit cache adalah angka yang sangat besar.

Ini adalah leverage terbesar Anda untuk menghemat.

Tapi cache memiliki kelemahan fatal. Itu harus cocok secara berurutan dari byte pertama permintaan, setiap perubahan di tengah, dari sana ke belakang semuanya hangus.

Secara spesifik, ada enam situasi:

1. /model ganti model: Cache setiap model independen. Beralih dari Sonnet ke Opus, seluruh riwayat percakapan di-prefill ulang dengan harga Opus, tanpa diskon.

2. /effort ganti tingkat upaya: Tingkat upaya juga bagian dari kunci cache, setelah berganti seluruh riwayat percakapan harus dihitung ulang.

3. Aktif/nonaktifkan Fast mode: Efeknya sama dengan dua jenis sebelumnya, cache langsung hangus.

4. /compact kompres percakapan: Percakapan ditulis ulang menjadi ringkasan, konten asli tidak cocok lagi, cache lama langsung hangus.

5. Waktu kedaluwarsa: Cache pengguna langganan aktif selama 1 jam, pengguna API default 5 menit. Setelah waktu habis, putaran berikutnya dihitung ulang secara penuh.

6. Pulihkan sesi lama: Terlalu lama terpisah, cache sudah lama hilang, hampir 100% harus dihitung ulang dengan harga penuh.

Berita buruknya, terkena satu saja berarti seluruh riwayat percakapan dari 0.1x kembali ke harga asli.

Berita baiknya, saat Anda tahu apa yang membuat cache hangus, Anda tahu cara menjaganya.

Misalnya, kunci model dan tingkat upaya di awal sesi, jangan ganti selama sesi. Jangan lakukan /compact saat cache masih hangat, lakukan saat bersiap istirahat.

Di sini, ada jebakan tersembunyi lain.

Mode opusplan setiap kali masuk dan keluar plan mengganti model. Masuk sekali, cache hangus sekali. Keluar, hangus lagi. Bolak-balik, setiap lompatan adalah satu prefill harga penuh.

Percakapan Anda, Diam-diam Semakin Gemuk

Cache membantu Anda menekan biaya mengirim ulang riwayat menjadi sepersepuluh.

Tapi ada satu hal yang tidak bisa dibantu. Riwayat Anda sendiri berkembang dari putaran ke putaran.

Setiap kali Claude membaca file, konten file ditambahkan ke percakapan. Setiap kali Claude menjalankan perintah, output juga ditambahkan. Dari putaran itu, setiap putaran berikutnya membawanya.

Percakapan putaran ke-40 mengirim ulang semua konten terkumulasi dari putaran 1 hingga 39.

Pertumbuhan ini mendekati tingkat kuadrat O(n2).

CClaude Code memiliki mekanisme cadangan.

Jika output perintah melebihi 30.000 karakter, tidak dimasukkan ke percakapan, tetapi ditulis ke file sementara, percakapan hanya berisi satu kalimat ringkasan. Tapi output di bawah 30.000 tidak dikelola.

Misalnya, setelah framework pengujian selesai berjalan, mencetak 400 baris catatan lolos, setiap baris puluhan karakter, total kurang dari 30.000, tidak mencapai ambang batas ini.

Jadi 400 baris ini tetap utuh di riwayat percakapan, setiap putaran berikutnya ikut dikirim ulang.

Untuk ini, blog Anthropic memberikan beberapa metode praktis untuk mengecilkan riwayat.

1. @ mereferensikan file.

Jangan memasukkan path secara manual untuk Claude cari sendiri. Referensi @ akan melampirkan file langsung ke pesan, menghemat satu operasi pembacaan.

Jika Anda hanya menyebutkan nama file, Claude mungkin mencari dengan grep dulu, membuka beberapa file untuk melihat mana yang benar. Kemudian semua percobaan ini akan masuk ke riwayat percakapan, hanya menambah biaya.

2. Tambahkan quiet flag ke perintah berisik.

Tulis di CLAUDE.md "run tests with npx vitest run --reporter=dot", sehingga setiap kali menjalankan pengujian hanya mengeluarkan beberapa baris hasil titik, bukan ratusan baris detail. Satu menit konfigurasi, menghemat ratusan baris konteks setiap sesi.

3. Subagent mengisolasi tugas output besar.

Subagent berjalan di jendela konteks independennya sendiri, hanya mengembalikan jawaban setelah selesai, file yang dibaca dan output perintah selama proses semuanya dibuang. Cocok untuk pekerjaan seperti "lihat log apa ada anomali" atau "baca file besar ini untuk saya". Anda hanya perlu kesimpulan, bukan prosesnya.

Dan yang paling penting.

4. /clear untuk ganti tugas.

Setelah memperbaiki satu bug, /clear, mulai hal berikutnya. File, output perintah, eksplorasi tengah dari bug sebelumnya, semuanya tidak relevan dengan tugas berikutnya. Tapi jika tidak dibersihkan, mereka menempati posisi, memakan token di setiap putaran berikutnya.

Jika tidak ingin benar-benar mengosongkan, /compact dapat mengecilkan percakapan menjadi ringkasan. Sepuluh hingga dua puluh ribu token dapat dikecilkan menjadi seribu hingga tiga ribu.

Selain itu, blog juga menyebutkan operasi yang kurang dikenal tapi gratis, /rewind.

Jika beberapa putaran terakhir melenceng, /rewind langsung memotong putaran-putaran itu, cache sebelumnya benar-benar tidak terganggu.

Mengelola Token, Juga Adalah Keterampilan Developer

Setelah membongkar semua operasi di atas, Anda akan menemukan pola. Orang yang menulis kode sedang mengembangkan seperangkat keterampilan baru.

Tidak ada hubungannya dengan framework atau bahasa, tetapi tahu model apa yang harus dipilih, bagaimana mengelola konteks, bagaimana menjaga cache, tingkat upaya yang tepat.

Kemampuan ini tidak ada setahun yang lalu. Tapi sekarang menentukan apakah Anda menghabiskan $3 atau $30 untuk tugas yang sama.

Anthropic sendiri adalah contoh terbaik.

80% kode mereka ditulis oleh AI, volume penggabungan kode meningkat 8 kali lipat dalam setahun, pengujian benchmark dipercepat 52 kali lipat. Dengan intensitas penggunaan AI seperti ini, jika tidak ada yang mengelola token, biaya inferensi saja bisa menghabiskan anggaran.

Dari sudut pandang ini, daripada mengatakan blog ini berbicara tentang trik penghematan biaya, lebih baik mengatakan itu adalah naluri baru yang perlu dimiliki orang yang menulis kode di era AI—

Mengetahui apa yang dikonsumsi setiap operasi Anda, mengetahui bagaimana membuat anggaran yang sama menghasilkan lebih banyak pekerjaan.

Orang yang memahaminya, menghemat bukan hanya beberapa dolar token.

Referensi:

https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions

Editor: Moses

Artikel ini berasal dari akun WeChat resmi "Xinzhiyuan", penulis: ASI Revelations

Pertanyaan Terkait

QApa enam cara yang disarankan Anthropic untuk menghemat token di Claude Code?

AEnam cara tersebut adalah: 1. /clear setelah tugas selesai, 2. Tentukan model dan tingkat upaya (effort level) di awal, 3. Gunakan @ untuk merujuk file, jangan ketik path manual, 4. Tambahkan parameter quiet flag untuk perintah dengan output panjang, 5. Lakukan /compact sebelum istirahat, 6. Serahkan tugas output besar ke subAgent.

QMengapa token output lebih mahal 5 kali lipat daripada token input?

AKarena prosesnya berbeda. Token input diproses secara paralel dalam satu kali perjalanan melalui GPU (prefill), sedangkan token output dihasilkan secara serial, di mana setiap token memerlukan perhitungan model sendiri (decode). Membuat 200 token berarti 200 perhitungan independen.

QApa itu 'prompt caching' dan bagaimana cara kerjanya menghemat biaya?

APrompt caching adalah sistem yang menyimpan hasil perhitungan dari awalan permintaan yang identik (seperti riwayat percakapan sebelumnya). Jika permintaan baru memiliki awalan yang sama persis, server memuat hasil cache alih-alih menghitung ulang, sehingga biaya pembacaan hanya 0.1x dari harga normal, menghemat 90%.

QApa saja tindakan yang dapat membuat cache prompt menjadi tidak valid?

AAda enam hal: 1. Mengganti model (/model), 2. Mengubah tingkat upaya (/effort), 3. Menyalakan/mematikan Fast mode, 4. Melakukan /compact, 5. Cache kadaluarsa karena waktu (1 jam untuk pengguna langganan, 5 menit untuk API), 6. Memulihkan sesi lama yang cache-nya sudah hilang.

QBagaimana cara mencegah riwayat percakapan menjadi terlalu 'gemuk' dan boros token?

ABeberapa cara: 1. Gunakan @ untuk lampirkan file langsung, 2. Tambahkan quiet flag pada perintah bising untuk mengurangi output, 3. Gunakan subAgent untuk tugas output besar agar hanya kesimpulan yang masuk ke percakapan utama, 4. Lakukan /clear setelah satu tugas selesai, atau /compact untuk meringkas, 5. Gunakan /rewind untuk membatalkan percakapan yang salah tanpa merusak cache sebelumnya.

Bacaan Terkait

Robert Kiyosaki Menceritakan Ramalan Mentornya tentang Kemunculan Bitcoin dan AI

Pengusaha dan penulis "Rich Dad Poor Dad" Robert Kiyosaki membagikan pengaruh mentor Richard Buckminster Fuller terhadap pandangan dunianya. Kiyosaki menghubungkan prediksi teknologi Fuller puluhan tahun lalu dengan kemunculan Bitcoin dan perkembangan kecerdasan buatan (AI). Ia mengutip Fuller yang disebutnya meramalkan perubahan besar seperti Bitcoin dan bangkitnya AI. Dalam tulisannya, Kiyosaki lebih menekankan ajaran Fuller tentang tujuan hidup. Ia mengutip perkataan Fuller bahwa manusia "milik alam semesta" dan menemukan tujuan sejati dengan "mendedikasikan hidup untuk memberi manfaat sebesar-besarnya bagi orang lain." Kiyosaki mengaku butuh waktu untuk memahami pesan ini, yang akhirnya mendorongnya beralih dari karier di bisnis musik (bekerja untuk band seperti The Police dan Iron Maiden) menciptakan permainan finansial Cashflow dan menulis buku larisnya. Kiyosaki juga mengulangi keyakinannya pada aset kripto. Ia dikenal sebagai pendukung Bitcoin dan Ethereum, yang dilihatnya sebagai pelindung kekayaan dari masalah sistem keuangan tradisional. Dia mengaku membeli Bitcoin saat investor lain panik. Prediksinya termasuk potensi keruntuhan pasar besar pada 2026, yang bisa menjadi peluang bagi investor yang siap dengan aset seperti Bitcoin, Ethereum, emas, dan perak. Dia pernah memprediksi Bitcoin bisa mencapai $750.000 dan Ethereum $95.000 di masa depan.

cryptonews.ru5j yang lalu

Robert Kiyosaki Menceritakan Ramalan Mentornya tentang Kemunculan Bitcoin dan AI

cryptonews.ru5j yang lalu

CEO Etherealize Sebut Blockchain Tertutup Wall Street sebagai 'Perlombaan ke Bawah'

Pendiri dan CEO Etherealize, Vivek Raman, mengkritik minat Wall Street yang tumbuh terhadap blockchain tertutup atau *permissioned*. Dalam wawancara dengan CoinDesk, Raman menyatakan bahwa jaringan konsorsium semacam itu memecah likuiditas dan mengembalikan industri ke sistem terisolasi, yang justru ingin dihapus oleh teknologi blockchain. Gelombang baru proyek semacam ini disebutnya sebagai "perlombaan ke dasar". Menurut Raman, sirkuit tertutup tidak saling berinteraksi dan merusak dua keunggulan kunci teknologi blockchain: interoperabilitas sistem dan konsentrasi likuiditas. Etherealize mempromosikan Ethereum sebagai lapisan dasar terbuka untuk pelaku institusional. Raman bersikeras bahwa privasi dan pembatasan akses seharusnya dibangun di atas infrastruktur publik — pada tingkat aplikasi atau solusi Lapisan-2 — bukan dengan membuat banyak jaringan tertutup terpisah. Dia membandingkan Ethereum dengan HTTP sebagai fondasi, sedangkan lapisan tambahan dengan akses terbatas dan privasi seperti HTTPS. Contoh dari gelombang terbaru solusi "tertutup" ini adalah Canton Network dari Digital Asset, proyek Arc dari Circle, dan Tempo dari Stripe. Raman menyebut fenomena ini sebagai "rantai konsorsium 2.0," dan mengingatkan pada inisiatif antarbank R3 dan ekosistem perusahaan Hyperledger yang tidak berkembang, yang banyak dipromosikan sejak 2016. Raman menegaskan keyakinannya bahwa infrastruktur global dan terbuka (*permissionless*) diperlukan sebagai lapisan dasar. Dia juga mengingatkan bahwa pada Juni, dia menyatakan lembaga keuangan tradisional telah mulai mengadopsi solusi berbasis Ethereum ke dalam proses bisnis nyata.

cryptonews.ru5j yang lalu

CEO Etherealize Sebut Blockchain Tertutup Wall Street sebagai 'Perlombaan ke Bawah'

cryptonews.ru5j yang lalu

Trading

Spot
活动图片