
Model entry-level Luna langsung dipotong harga secara drastis, harga input per juta Token turun dari 1 USD menjadi 0,2 USD, harga output dari 6 USD menjadi 1,2 USD.
Dikonversi ke RMB, setara dengan harga input turun dari sekitar 6,8 yuan menjadi 1,35 yuan, harga output dari sekitar 40,6 yuan menjadi 8,1 yuan.
Model Terra yang diposisikan sebagai 'main daily work' juga turun harga 20%, harga input dan output masing-masing turun menjadi 2 USD dan 12 USD.
Dikonversi ke RMB, masing-masing sekitar 13,5 yuan dan 81,2 yuan.
Hanya model flagship Sol yang tetap dengan harga asli, tetapi meluncurkan Fast mode, kecepatan maksimum mencapai 2,5 kali kecepatan mode standar, akselerasi tanpa kenaikan harga.

Setelah Codex dengan gencar mengatur ulang pemakaian, penurunan harga pun langsung diatur, OpenAI kamu mau mematikan siapa...
Perang harga ini langsung memanas.
OpenAI menyatakan, penurunan harga ini karena GPT-5.6 Sol membantu menghemat biaya dirinya sendiri.
GPT-5.6 Sol terlibat dalam peningkatan dirinya sendiri, efisiensi mencapai lompatan peningkatan yang signifikan, oleh karena itu diberikan sebagai bentuk apresiasi kepada pengguna baru dan lama~
Cara 'menginjak kaki sendiri untuk terbang ke atas' ini, OpenAI kamu juga memainkannya

.
Dua Model Turun Harga, Satu Model Tambah Cepat
Sekarang, harga API ketiga model GPT-5.6 adalah:
GPT-5.6 Luna: per juta Token input 0,2 USD, output 1,2 USD;
GPT-5.6 Terra: per juta Token input 2 USD, output 12 USD;
GPT-5.6 Sol: per juta Token input 5 USD, output 30 USD.

Setelah penurunan harga, Luna mengalami penurunan yang sangat drastis.
Harga inputnya sudah setara dengan generasi sebelumnya GPT-5.4 nano, harga output bahkan lebih murah 0,05 USD.
Tapi pekerjaan yang dilakukan kedua model ini tidak sepenuhnya sama, GPT-5.4 nano terutama ditujukan untuk tugas sederhana dan frekuensi tinggi seperti klasifikasi, ekstraksi informasi, dan peringkat.
GPT-5.6 Luna diposisikan oleh OpenAI sebagai model yang ditujukan untuk beban kerja yang sensitif terhadap biaya, dapat memanggil alat, menangani konteks panjang, dan menjalankan alur kerja multi-langkah.
Sederhananya, OpenAI sedang menjual model yang mendukung kerja Agen, dengan harga model kecil sederhana masa lalu.
Terra relatif lebih terkendali, turun harga 20%.
Sol tetap mempertahankan harga asli, menambahkan Fast mode, kecepatan maksimum mencapai 2,5 kali kecepatan mode standar, harganya 2 kali lipat dari mode standar, tingkat kecerdasan model tidak berubah.
Ini juga akan menggantikan Priority Processing sebelumnya. Permintaan API yang sebelumnya menggunakan tag priority, dapat beralih otomatis ke Fast mode.
Menurut keterangan resmi, penyesuaian ini juga akan diterapkan di Codex dan ChatGPT Work.
Harga langganan tidak akan diturunkan, total kuota pengguna juga tidak akan bertambah, tetapi saat memanggil Terra dan Luna, konsumsi kuota akan berkurang sesuai.
Dengan biaya langganan yang sama, model dapat melakukan lebih banyak pekerjaan.
OpenAI juga sekaligus mengganti model Auto-review di ChatGPT dan Codex CLI dari GPT-5.4 menjadi GPT-5.6 Luna.
Auto-review bertanggung jawab memeriksa kode dan hasil modifikasi di latar belakang, termasuk dalam tugas Agen frekuensi tinggi yang khas.
Dengan kombinasi upgrade model dan penurunan harga Luna, OpenAI memperkirakan biayanya akan turun menjadi sekitar sepersepuluh dari sebelumnya.
Model murah tidak lagi hanya bertanggung jawab atas 'pekerjaan sampingan' tradisional seperti klasifikasi dan ekstraksi, tetapi mulai memasuki tahapan seperti review kode, pemantauan latar belakang yang memerlukan penilaian dan pemanggilan alat.
Saat ini, posisi ketiga model adalah:
Untuk tugas dengan anggaran sensitif dan volume panggilan besar, serahkan ke Luna;
Untuk pekerjaan harian biasa, serahkan ke Terra;
Untuk tugas dengan tingkat kesulitan tinggi, terus gunakan Sol;
Jika bahkan menunggu pun dianggap lambat, beli kecepatan dengan membayar dua kali lipat harganya.
GPT-5.6 Mulai Berpartisipasi dalam Menurunkan Biaya Dirinya Sendiri
Mengapa tiba-tiba turun harga?
OpenAI menyatakan, alasannya adalah karena GPT-5.6 Sol berpartisipasi dalam pengoptimalan sistem produksi mereka sendiri.
Peningkatan efisiensi yang dihasilkannya, selanjutnya berubah menjadi angka diskon pada tabel harga.
Secara spesifik, GPT-5.6 Sol menulis ulang dan mengoptimalkan sebagian GPU Kernel di lingkungan produksi, merancang dan menjalankan ratusan eksperimen generasi Token, serta berpartisipasi dalam pemantauan pelatihan, melakukan intervensi saat muncul masalah.
Hasil akhirnya juga menonjol: optimisasi GPU Kernel produksi, menurunkan biaya layanan end-to-end GPT-5.6 sebesar 20%; peningkatan dalam spekulasi decoding, meningkatkan efisiensi generasi Token lebih dari 15%.

GPU Kernel dapat dipahami sebagai program dasar yang menjalankan tugas komputasi spesifik model di GPU.
Model itu sendiri tidak perlu berubah, selama program ini ditulis lebih efisien, GPU yang sama dapat menyelesaikan komputasi lebih cepat, menangani lebih banyak permintaan, dan biaya per panggilan juga akan turun.
Spekulasi decoding adalah saat menghasilkan jawaban, pertama-tama secara massal 'menebak' Token yang mungkin muncul berikutnya, baru kemudian diserahkan ke model utama untuk diverifikasi. Semakin akurat tebakannya, semakin sedikit langkah yang perlu dihasilkan satu per satu dan ditunggu.
Kedua optimisasi ini tidak mengurangi kemampuan model, tetapi dapat membuat model yang sama berjalan lebih cepat dan lebih murah.
Namun, ini belum sepenuhnya GPT-5.6 melakukan upgrade sendiri secara mandiri.
OpenAI secara khusus menekankan, seluruh proses ini masih dipimpin oleh manusia.
Model dapat menulis kode, menjalankan eksperimen, memantau anomali, tetapi bagaimana tujuan ditetapkan, apakah hasil dapat digunakan, apakah kode masuk ke lingkungan produksi, masih memerlukan 'Human in the Loop'.
OMT
Terakhir, ada satu perubahan baru lagi.
Penurunan harga kali ini memiliki titik fokus yang sangat spesifik: Alur kerja (workflow) Agen.
Luna yang mendapat potongan harga paling drastis, bukan hanya model kecil tradisional yang digunakan untuk klasifikasi dan ekstraksi.
Menurut posisi OpenAI, ia dapat memanggil alat, menjalankan tugas multi-langkah, terutama ditujukan untuk beban kerja frekuensi tinggi dan sensitif terhadap biaya.
Oleh karena itu, penurunan harga Luna sebesar 80%, juga merupakan upaya menurunkan ambang batas bagi Agen untuk berjalan dalam jangka panjang.
Membuat tugas-tugas seperti review, verifikasi, dan pemantauan yang sebelumnya tidak dapat sering dilakukan karena biaya terlalu tinggi, memiliki kesempatan untuk menjadi langkah rutin dalam alur kerja.
Dikombinasikan dengan partisipasi GPT-5.6 dalam mengoptimalkan sistem produksinya sendiri, sebuah siklus baru muncul:
Model berpartisipasi meningkatkan efisiensi operasional, biaya turun; setelah harga turun, model masuk ke lebih banyak alur kerja frekuensi tinggi; skala panggilan meluas, mendorong optimisasi efisiensi putaran berikutnya.
Flywheel (roda gila) penurunan harga milik OpenAI ini, sudah mulai terbentuk.
Setelah serangkaian operasi ini, sekarang tekanan langsung diberikan ke A Club (mungkin maksudnya Anthropic/Claude atau kompetitor lain):
"Giliranmu."

Referensi link:[1]https://x.com/OpenAI/status/2082878156483219672[2]https://x.com/sama/status/2082880720989532597
Artikel ini dari akun WeChat public "Quantum Bit", penulis: Perhatian Teknologi Terdepan







