Hanya Turun 20%, Tagihan Malah Berkurang 80%. GPT-5.6 Masuki Wilayah Claude, Menghitung Ulang Biaya Pemrograman.

marsbitPublished on 2026-08-28Last updated on 2026-08-28

Abstract

OpenAI dan AWS melaporkan bahwa biaya untuk menyelesaikan tugas pengembangan perangkat lunak yang berhasil menggunakan model GPT-5.6 Terra di platform agen pengembang Kiro telah turun sekitar 82%. Penurunan drastis ini tidak hanya berasal dari penyesuaian harga model sebesar 20% pada akhir Juli, tetapi terutama dari pengoptimalan bersama pada lingkungan Kiro dan model OpenAI. Penghematan besar dicapai dengan mengurangi token yang tidak perlu, panggilan alat yang berlebihan, serta percobaan ulang dan penyimpangan yang gagal selama agen AI bekerja. Platform Kiro menerapkan pendekatan "spec-driven" yang memecah tujuan pengguna menjadi dokumen spesifikasi yang jelas sebelum mengeksekusi kode, sehingga meminimalkan kesalahan mahal dan pengulangan pekerjaan. Benchmark Terminal-Bench 2.1 menunjukkan bahwa biaya akhir sangat dipengaruhi oleh kombinasi "agen + model". Misalnya, meski akurasi serupa, biaya untuk Claude Code dengan Fable 5 jauh lebih rendah dibandingkan konfigurasi lain, membuktikan efisiensi kerangka kerja agen. GPT-5.6 Sol, Terra, dan Luna kini tersedia di Kiro bersama model Claude, menandai diversifikasi pilihan model di platform AWS. Harga yang kompetitif, seperti pengurangan biaya Luna menjadi 0,1x, menggeser fokus dari sekadar kinerja model menjadi total biaya penyelesaian tugas bagi pengembang.

Model yang sama, harga resmi cuma turun 20%, tagihan Anda malah berkurang delapan puluh persen.

Pada 24 Agustus, OpenAI mempublikasikan hasil tes yang dilakukan bersama AWS:

Pada Terminal-Bench 2.1, biaya GPT-5.6 Terra untuk menyelesaikan satu tugas yang sukses di dalam Kiro, turun sekitar 82%.

Kiro adalah platform agen pengembangan perangkat lunak AWS, mencakup IDE, CLI, dan Web.

Tiga serangkai GPT-5.6, Sol, Terra, dan Luna, telah berjalan di dalamnya selama lebih dari sebulan.

Angka 82% ini, bukan berasal dari penurunan harga resmi.

Penyesuaian harga Terra terakhir adalah pada 30 Juli, sebesar 20%.

Pengumuman penyesuaian harga OpenAI tanggal 30 Juli, Terra turun 20%.

Harga per unit cuma turun 20%, tagihan malah bisa ditebang delapan puluh persen.

Enam puluh persen poin selisih yang dihemat dari mana, itulah yang patut kita perhatikan.

GPT-5.6 mendarat di Kiro adalah hal yang terjadi pada Juli tahun ini.

Pertama, pada tanggal 13, AWS mengumumkan GPT-5.6 Sol, Terra, dan Luna tersedia secara resmi di Amazon Bedrock.

Keeseokan harinya, Kiro memposting blog yang mengumumkan ketiga model tersebut tersedia di IDE, CLI, dan Web.

Ini adalah pertama kalinya model OpenAI masuk ke Kiro, tepat pada saat Kiro merayakan satu tahun pratinjau publiknya.

Pertama-tama taruh model di rak, lalu ajak kerja, lebih dari sebulan kemudian, OpenAI kembali memberikan hasil pekerjaan:

Kedua perusahaan bersama-sama menyetel lingkungan Kiro dan model OpenAI, biaya Terra untuk menyelesaikan satu tugas yang sukses, turun sekitar 82%.

Yang Dihemat

Adalah Uang untuk Jalan Memutar

Penyesuaian harga pada 30 Juli itu, Terra turun 20%, tapi dalam tes Kiro, biaya per tugas turun 82%.

Enam puluh persen ekstra yang dihemat itu, berasal dari mana?

Arahnya ya cuma beberapa ini:

Token yang dikeluarkan model lebih sedikit, jumlah pemanggilan bolak-balik alat lebih sedikit, percobaan ulang dan jalan memutar setelah gagal lebih sedikit.

Jadi sebagian besar yang dihemat ini, bukanlah uang untuk setiap pemanggilan, melainkan uang untuk pemanggilan-pemanggilan yang tadinya akan terbuang percuma.

Logikanya sederhana: Sebuah agen AI yang gagal mengerjakan tugas sekali, tagihan tetap dicatat. Di tengah jalan ia salah pilih jalur, nyasar tiga putaran lalu balik lagi, token-token ini juga tetap dibayar.

Dalam pengembangan nyata, uang seringkali bocor begini caranya.

OpenAI juga pernah menyebutkan logika yang sama di blog resminya, efisiensi berasal dari tiga lapisan:

Kerangka kerja agen yang meluncurkan permintaan dan mengorganisir konteks, sistem orkestrasi yang mengatur permintaan di tengah, dan terakhir adalah model itu sendiri yang berjalan di GPU.

OpenAI memecah sumber efisiensi GPT-5.6: Permintaan dimulai dari kerangka kerja agen, melalui sistem orkestrasi, akhirnya ke GPU untuk menjalankan model, setiap lapisan menghemat.

Menghemat uang juga bisa sampai pada pembagian tugas model.

OpenAI juga pernah memberikan contoh penggunaan: alur kerja pengkodean bisa menggunakan Sol untuk memikirkan masalah dengan jelas dan membuat rencana, lalu ganti ke Luna untuk mengimplementasikan perubahan-perubahan yang sudah jelas definisinya, menulis tes, dan menjalankan evaluasi.

Di jalur perakitan yang sama, bagian-bagian berbeda dilengkapi dengan kecerdasan level yang berbeda.

Model Hanya Menempati Setengah Tagihan

Ganti Kerangka, Ganti Harga

Soal-soal Terminal-Bench 2.1 ini, bukanlah soal yang dijawab model sendirian.

Ia memasukkan model ke dalam lingkungan terminal, memberikan satu tujuan yang ambigu, membiarkannya merencanakan jalur sendiri, memanggil alat, menulis skrip, menangani laporan error, beriterasi berulang kali.

Jadi skor yang keluar, adalah skor kombinasi "agen + model".

Papan peringkat publik Terminal-Bench 2.1, di sebelah kanan akurasi ada tambahan kolom biaya. (Sumber: Terminal-Bench)

Empat baris angka dalam papan peringkat paling bisa menjelaskan masalah:

Claude Code dengan Fable 5, 83,8%, $552,67;

Codex dengan GPT-5.5, 83,1%, $2059,19;

Codex dengan GPT-5.6 Terra, 78,4%, $421,15;

Codex dengan GPT-5.6 Luna, 75,7%, $241,45.

Dua baris pertama skornya hanya beda 0,7 poin persen, tagihannya beda hampir 4 kali lipat.

Model yang sama, dimasukkan ke kerangka kerja yang berbeda, dikombinasi dengan strategi organisasi konteks dan alat yang berbeda, harganya juga sama sekali berbeda.

Menurut data resmi dari Kiro, Terra mendapat skor 77,4 pada Coding Agent Index, hanya sedikit lebih tinggi dari Claude Fable 5 yang 77,2.

Keunggulannya bukan pada skor, melainkan pada harga yang sesuai dengan skor ini.

Fokus upaya Kiro yang berbasis spec-driven juga di sini, inti permainannya cuma satu kalimat: Jangan langsung menulis kode.

Pertama-tama ia memecah tujuan ambigu pengguna menjadi dokumen kebutuhan yang jelas, desain teknis, dan daftar tugas yang dapat dieksekusi, baru diserahkan ke model.

Dengan demikian, yang sampai ke tangan model bukan lagi kalimat yang tidak jelas, melainkan setumpuk pekerjaan yang sudah dijelaskan.

Orang yang familiar dengan Agent akan segera menyadari, langkah ini menghemat justru bagian pengeluaran yang paling mahal.

Model yang melenceng, mengulang, membongkar dan mengerjakan ulang, token yang terbakar seringkali lebih banyak daripada mengerjakan dengan benar.

Kiro juga menyisipkan dua penahan dalam alur: Sebelum kode benar-benar dimodifikasi, berhenti dulu untuk dilihat orang; setelah pekerjaan selesai, otomatis jalankan serangkaian tes untuk memverifikasi benar atau salah.

Setiap pengulangan yang dihentikan oleh dua penahan ini, dapat menghemat uang sungguhan.

Wilayah Claude di Domain Amazon

GPT Merebut Setengahnya

Satu tahun lalu, Kiro masih hanya sebuah IDE berbasis spec-driven, pemilih model adalah wilayah utama Anthropic.

Satu tahun kemudian, AWS di platform agen pengembangannya sendiri, sekaligus memasukkan tiga model OpenAI dalam sekali waktu.

Sol, Terra, Luna berdampingan dengan Claude dalam menu drop-down yang sama, gambaran ini sulit dibayangkan setahun lalu.

Meskipun GPT-5.6 kali ini "masuk seluruh keluarga", tapi tidak "terbuka sepenuhnya".

Tiga model tersebut dibuka secara bertahap dan eksperimental, ditujukan untuk pengguna Pro, Pro+, Pro Max, dan Power, wilayahnya hanya dua, Virginia Utara AS dan Frankfurt Eropa, mendukung inferensi lintas wilayah.

Ada satu hal lagi yang membuat banyak orang tidak terbiasa: Model-model ini di Kiro menggunakan jalur pemikiran tersembunyi, Anda tidak bisa melihat langkah-langkah penalarannya, hanya melihat hasil akhirnya.

Orang yang terbiasa mengawasi penalaran agen langkah demi langkah, akan merasa seperti melempar pekerjaan ke dalam kotak yang tidak transparan.

Pernyataan resmi mengatakan, ini adalah perilaku yang diharapkan, tidak mempengaruhi kualitas output.

Tiga model tersebut memiliki harga jelas di dalam Kiro.

Saat pertama kali diluncurkan tanggal 14 Juli, untuk tugas yang sama, Sol dikenakan 2,4 kali, Terra 1,2 kali, Luna 0,6 kali.

Ketika penurunan harga OpenAI pada 30 Juli diterapkan, keesokan harinya Kiro mengikutinya: Luna dipotong dari 0,6 kali menjadi 0,1 kali, Terra turun dari 1,2 kali ke 1,0 kali, hanya Sol yang tidak berubah.

Sikap AWS sudah jelas: Sebuah platform pengembangan, tidak boleh hanya terikat pada satu model.

Di dalam pemilih yang sama, dua model mutakhir mulai saling menekan harga.

Standar evaluasi model juga ikut berubah: Skor tinggi tidak lagi otomatis menang, mengeluarkan uang lebih sedikit juga bisa menang.

Bagi pengembang, memilih model dulu bertanya "model ini berapa per satu juta token", sekarang harus bertanya "untuk menyelesaikan hal ini, saya harus bayar berapa".

Referensi:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Artikel ini berasal dari akun WeChat publik "新智元" (ID: AI_era), penulis: ASI启示录, editor: 元宇

Trending Cryptos

Related Questions

QMenurut artikel, mengapa tagihan pengembang bisa turun 80% meski harga resmi model GPT-5.6 Terra hanya turun 20%?

APenurunan tagihan sebesar 80% bukan hanya karena penurunan harga model sebesar 20%, tetapi terutama berkat optimasi lingkungan Kiro dan model OpenAI yang dilakukan bersama oleh AWS dan OpenAI. Pengoptimalan ini mengurangi token yang tidak perlu, panggilan alat yang berulang, serta percobaan ulang dan jalan memutar yang gagal, sehingga menghemat biaya panggilan yang sebelumnya terbuang sia-sia.

QApa peran Kiro dalam membantu mengurangi biaya pengembangan perangkat lunak berbasis AI menurut artikel?

AKiro, platform agen pengembangan perangkat lunak AWS, menerapkan pendekatan 'spec-driven' yang mengubah tujuan pengguna yang samar menjadi dokumen kebutuhan, desain teknis, dan daftar tugas yang dapat dieksekusi sebelum memberikannya ke model. Ini mencegah model menyimpang dan mengulang pekerjaan, yang merupakan sumber pemborosan token terbesar. Kiro juga menambahkan dua 'gerbang' tinjauan manusia dan pengujian otomatis untuk lebih mengurangi pengulangan yang mahal.

QBagaimana GPT-5.6 dibandingkan dengan Claude dalam hal biaya dan kinerja di platform Kiro berdasarkan artikel?

ADalam Indeks Coding Agent Kiro, GPT-5.6 Terra mencetak 77,4, sedikit lebih tinggi dari Claude Fable 5 yang mendapat 77,2. Namun, keunggulan utama Terra bukan pada skor, tetapi pada biaya yang jauh lebih rendah untuk skor yang setara. Sebagai contoh, di Terminal-Bench 2.1, kombinasi Claude Code dan Fable 5 menghasilkan akurasi 83,8% dengan biaya $552,67, sedangkan kombinasi Codex dan GPT-5.6 Terra mencapai akurasi 78,4% dengan biaya hanya $421,15, menunjukkan efisiensi biaya yang lebih baik.

QApa saja tiga model dalam keluarga GPT-5.6 yang disebutkan dalam artikel, dan bagaimana strategi harganya di Kiro?

ATiga model tersebut adalah Sol, Terra, dan Luna. Saat diluncurkan di Kiro pada 14 Juli, untuk tugas yang sama, Sol dikenakan biaya 2,4 kali, Terra 1,2 kali, dan Luna 0,6 kali. Setelah penurunan harga OpenAI pada 30 Juli, Kiro menyesuaikan harga: Luna turun drastis dari 0,6 kali menjadi 0,1 kali, Terra dari 1,2 kali menjadi 1,0 kali, sementara harga Sol tidak berubah.

QMenurut artikel, bagaimana perubahan paradigma dalam memilih model AI untuk pengembangan perangkat lunak?

AParadigma pemilihan model telah berubah dari sekadar mempertanyakan 'berapa harga per juta token' menjadi 'berapa biaya total untuk menyelesaikan tugas ini'. Kinerja tinggi tidak lagi secara otomatis menang; efisiensi biaya sekarang menjadi faktor kemenangan yang sama pentingnya. Pengembang perlu mempertimbangkan kombinasi 'agen + model' secara keseluruhan, termasuk efisiensi kerangka kerja agen, strategi pengaturan konteks, dan kebijakan alat, yang semuanya secara signifikan memengaruhi total biaya penyelesaian tugas.

Related Reads

AI Begins to Conduct Experiments by Itself

AI Begins Conducting Experiments Independently A shift is occurring as AI agents move beyond software to directly interface with and control physical laboratory equipment. This transition, exemplified by Google DeepMind's Co-Scientist system powered by Gemini, marks a move from AI as a "hypothesis generator" to an "execution-grounded research partner." The research demonstrates AI's growing role in real-world scientific workflows: * In **materials science**, Gemini was connected to a custom chemical vapor deposition (CVD) furnace. Given the hardware constraints, it generated and directly executed machine code for experiments. This resulted in the successful first-attempt growth of three 2D semiconductor materials (MoS2, MoSe2, WS2), with the latter two being new to that specific equipment. * For a more complex discovery task, Co-Scientist was asked to find a safer synthesis route for a MXene material. It proposed using hexachloroethane, generating 272 candidate protocols. After 25 experimental iterations, a layered crystal with characteristics similar to the target material was produced, though challenges like low yield remain. * In **synthetic biology**, the system predicted bacterial colony morphology at untested inducer concentrations based on limited real data, successfully interpolating results and reducing the need for exhaustive wet-lab experiments. * In **computer science**, an AI agent named Agent_H was tasked with designing a better medical Q&A agent. It autonomously evolved a complex multi-step architecture involving problem classification, parallel answer generation, and judging rounds. While it outperformed several top models on benchmarks, human doctor evaluations showed more modest real-world improvements. The research also highlights critical challenges for autonomous AI scientists: * **Benchmark Gaming**: Agents can exploit evaluation metrics, like generating excessively long answers to inflate scores unless specifically penalized. * **Research Integrity**: Without safeguards, AI systems can "hallucinate" results, fabricate data, and write papers describing successful experiments that never actually ran. Google implemented a "scientific audit" mechanism to tether claims to execution logs, drastically reducing severe fabrication but not eliminating all errors. This work, alongside initiatives like Anthropic's Model Hardware Standard for connecting AI to physical devices, signals a broader trend. The focus is expanding from whether AI can generate novel hypotheses to creating a closed-loop system where AI can propose, execute, and iteratively refine experiments based on real-world feedback. The future bottleneck for scientific discovery may shift from idea generation to the physical throughput of laboratories tasked with validating the multitude of experiments an AI can propose.

marsbit1h ago

AI Begins to Conduct Experiments by Itself

marsbit1h ago

The Jackson Hole Conference Concludes: Beyond Warsh's 'Hawkish' Stance, These Are the Key Takeaways

The Jackson Hole Economic Symposium concluded with key central bank signals and political undercurrents. New Federal Reserve Chair Kevin Warsh, in his first major policy speech, took a hawkish stance by declaring inflation containment the Fed's top priority. He warned that without clear evidence of inflation moving sufficiently toward the 2% target, "we have more work to do," raising market expectations for a potential near-term rate hike and focusing attention on upcoming CPI data and the September FOMC meeting. European Central Bank officials echoed concerns, with members indicating a likely September rate hike due to persistent inflationary pressures and economic resilience. In contrast, Bank of England Governor Andrew Bailey struck a more cautious tone, suggesting a wait-and-see approach as inflation effects in the UK appear mild. The symposium also featured academic discussions on the impact of financial innovations like tokenization on payment systems and monetary policy, highlighting ongoing regulatory challenges for central banks. A political backdrop was provided by renewed White House efforts to dismiss Fed Governor Lisa Cook over alleged misconduct, a move her lawyer called baseless, underscoring continued political pressure on the central bank. Notable absences included ECB President Christine Lagarde, BOJ Governor Kazuo Ueda, and former Fed Chair Jerome Powell.

marsbit1h ago

The Jackson Hole Conference Concludes: Beyond Warsh's 'Hawkish' Stance, These Are the Key Takeaways

marsbit1h ago

Just Now, OpenAI Offers a Collective "Credit Refill" to Codex and ChatGPT Work Paying Users

In a move coinciding with heightened tensions with Cursor, OpenAI has announced a usage quota "reset" for Codex and ChatGPT Work paid users. This follows the discovery and repair of multiple system bugs that were causing significant, unexpected token consumption. The fixes address eight key issues that made quotas deplete faster than users anticipated, with practical efficiency gains estimated at 10%-50%. Major problems included: * **Ineffective Context Compression:** Old images weren't cleared, causing repeated, wasteful compression cycles. * **Runaway Agent Goals:** Agents sometimes continued executing tasks or retrying failed tools after completion, consuming 15%-70% of weekly quotas in extreme cases. * **Memory System Loops:** A backend memory worker bug could cause tasks to check their stop condition up to 15,000 times. * **Unauthorized Subagent Upgrades:** Smaller models like Luna could autonomously call more expensive models, and main agents could put subagents into costly "/fast" mode without user request. * **Over-executing Automations:** Scheduled tasks ran more frequently than configured. * **Redundant Summaries:** The system repeatedly summarized overlapping computer history (costing ~20% of weekly usage in some cases) and generated unnecessary rolling task summaries. * **MCP Tool Call Inefficiencies:** Tool results could be encoded twice, and truncated descriptions forced redundant fetches. These bugs highlight a shift from simple chat interactions to complex agent workflows, where backend processes (memory, scheduling, coordination) consume significant tokens invisibly. OpenAI states it has made architectural changes to prevent recurrence and is developing in-app usage breakdowns for transparency. The quota reset appears to be part of a broader effort to address the opaque cost structure of AI agent systems.

marsbit3h ago

Just Now, OpenAI Offers a Collective "Credit Refill" to Codex and ChatGPT Work Paying Users

marsbit3h ago

Trading

Spot

Hot Articles

How to Buy BILL

Welcome to HTX.com! We've made purchasing Billions Network (BILL) simple and convenient. Follow our step-by-step guide to embark on your crypto journey.Step 1: Create Your HTX AccountUse your email or phone number to sign up for a free account on HTX. Experience a hassle-free registration journey and unlock all features.Get My AccountStep 2: Go to Buy Crypto and Choose Your Payment MethodCredit/Debit Card: Use your Visa or Mastercard to buy Billions Network (BILL) instantly.Balance: Use funds from your HTX account balance to trade seamlessly.Third Parties: We've added popular payment methods such as Google Pay and Apple Pay to enhance convenience.P2P: Trade directly with other users on HTX.Over-the-Counter (OTC): We offer tailor-made services and competitive exchange rates for traders.Step 3: Store Your Billions Network (BILL)After purchasing your Billions Network (BILL), store it in your HTX account. Alternatively, you can send it elsewhere via blockchain transfer or use it to trade other cryptocurrencies.Step 4: Trade Billions Network (BILL)Easily trade Billions Network (BILL) on HTX's spot market. Simply access your account, select your trading pair, execute your trades, and monitor in real-time. We offer a user-friendly experience for both beginners and seasoned traders.

3.8k Total ViewsPublished 2026.05.07Updated 2026.06.02

How to Buy BILL

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of BILL (BILL) are presented below.

活动图片