Hanya Turun 20%, Tagihan Malah Berkurang 80%. GPT-5.6 Masuki Wilayah Claude, Menghitung Ulang Biaya Pemrograman.

marsbit发布于2026-08-28更新于2026-08-28

文章摘要

OpenAI dan AWS melaporkan bahwa biaya untuk menyelesaikan tugas pengembangan perangkat lunak yang berhasil menggunakan model GPT-5.6 Terra di platform agen pengembang Kiro telah turun sekitar 82%. Penurunan drastis ini tidak hanya berasal dari penyesuaian harga model sebesar 20% pada akhir Juli, tetapi terutama dari pengoptimalan bersama pada lingkungan Kiro dan model OpenAI. Penghematan besar dicapai dengan mengurangi token yang tidak perlu, panggilan alat yang berlebihan, serta percobaan ulang dan penyimpangan yang gagal selama agen AI bekerja. Platform Kiro menerapkan pendekatan "spec-driven" yang memecah tujuan pengguna menjadi dokumen spesifikasi yang jelas sebelum mengeksekusi kode, sehingga meminimalkan kesalahan mahal dan pengulangan pekerjaan. Benchmark Terminal-Bench 2.1 menunjukkan bahwa biaya akhir sangat dipengaruhi oleh kombinasi "agen + model". Misalnya, meski akurasi serupa, biaya untuk Claude Code dengan Fable 5 jauh lebih rendah dibandingkan konfigurasi lain, membuktikan efisiensi kerangka kerja agen. GPT-5.6 Sol, Terra, dan Luna kini tersedia di Kiro bersama model Claude, menandai diversifikasi pilihan model di platform AWS. Harga yang kompetitif, seperti pengurangan biaya Luna menjadi 0,1x, menggeser fokus dari sekadar kinerja model menjadi total biaya penyelesaian tugas bagi pengembang.

Model yang sama, harga resmi cuma turun 20%, tagihan Anda malah berkurang delapan puluh persen.

Pada 24 Agustus, OpenAI mempublikasikan hasil tes yang dilakukan bersama AWS:

Pada Terminal-Bench 2.1, biaya GPT-5.6 Terra untuk menyelesaikan satu tugas yang sukses di dalam Kiro, turun sekitar 82%.

Kiro adalah platform agen pengembangan perangkat lunak AWS, mencakup IDE, CLI, dan Web.

Tiga serangkai GPT-5.6, Sol, Terra, dan Luna, telah berjalan di dalamnya selama lebih dari sebulan.

Angka 82% ini, bukan berasal dari penurunan harga resmi.

Penyesuaian harga Terra terakhir adalah pada 30 Juli, sebesar 20%.

Pengumuman penyesuaian harga OpenAI tanggal 30 Juli, Terra turun 20%.

Harga per unit cuma turun 20%, tagihan malah bisa ditebang delapan puluh persen.

Enam puluh persen poin selisih yang dihemat dari mana, itulah yang patut kita perhatikan.

GPT-5.6 mendarat di Kiro adalah hal yang terjadi pada Juli tahun ini.

Pertama, pada tanggal 13, AWS mengumumkan GPT-5.6 Sol, Terra, dan Luna tersedia secara resmi di Amazon Bedrock.

Keeseokan harinya, Kiro memposting blog yang mengumumkan ketiga model tersebut tersedia di IDE, CLI, dan Web.

Ini adalah pertama kalinya model OpenAI masuk ke Kiro, tepat pada saat Kiro merayakan satu tahun pratinjau publiknya.

Pertama-tama taruh model di rak, lalu ajak kerja, lebih dari sebulan kemudian, OpenAI kembali memberikan hasil pekerjaan:

Kedua perusahaan bersama-sama menyetel lingkungan Kiro dan model OpenAI, biaya Terra untuk menyelesaikan satu tugas yang sukses, turun sekitar 82%.

Yang Dihemat

Adalah Uang untuk Jalan Memutar

Penyesuaian harga pada 30 Juli itu, Terra turun 20%, tapi dalam tes Kiro, biaya per tugas turun 82%.

Enam puluh persen ekstra yang dihemat itu, berasal dari mana?

Arahnya ya cuma beberapa ini:

Token yang dikeluarkan model lebih sedikit, jumlah pemanggilan bolak-balik alat lebih sedikit, percobaan ulang dan jalan memutar setelah gagal lebih sedikit.

Jadi sebagian besar yang dihemat ini, bukanlah uang untuk setiap pemanggilan, melainkan uang untuk pemanggilan-pemanggilan yang tadinya akan terbuang percuma.

Logikanya sederhana: Sebuah agen AI yang gagal mengerjakan tugas sekali, tagihan tetap dicatat. Di tengah jalan ia salah pilih jalur, nyasar tiga putaran lalu balik lagi, token-token ini juga tetap dibayar.

Dalam pengembangan nyata, uang seringkali bocor begini caranya.

OpenAI juga pernah menyebutkan logika yang sama di blog resminya, efisiensi berasal dari tiga lapisan:

Kerangka kerja agen yang meluncurkan permintaan dan mengorganisir konteks, sistem orkestrasi yang mengatur permintaan di tengah, dan terakhir adalah model itu sendiri yang berjalan di GPU.

OpenAI memecah sumber efisiensi GPT-5.6: Permintaan dimulai dari kerangka kerja agen, melalui sistem orkestrasi, akhirnya ke GPU untuk menjalankan model, setiap lapisan menghemat.

Menghemat uang juga bisa sampai pada pembagian tugas model.

OpenAI juga pernah memberikan contoh penggunaan: alur kerja pengkodean bisa menggunakan Sol untuk memikirkan masalah dengan jelas dan membuat rencana, lalu ganti ke Luna untuk mengimplementasikan perubahan-perubahan yang sudah jelas definisinya, menulis tes, dan menjalankan evaluasi.

Di jalur perakitan yang sama, bagian-bagian berbeda dilengkapi dengan kecerdasan level yang berbeda.

Model Hanya Menempati Setengah Tagihan

Ganti Kerangka, Ganti Harga

Soal-soal Terminal-Bench 2.1 ini, bukanlah soal yang dijawab model sendirian.

Ia memasukkan model ke dalam lingkungan terminal, memberikan satu tujuan yang ambigu, membiarkannya merencanakan jalur sendiri, memanggil alat, menulis skrip, menangani laporan error, beriterasi berulang kali.

Jadi skor yang keluar, adalah skor kombinasi "agen + model".

Papan peringkat publik Terminal-Bench 2.1, di sebelah kanan akurasi ada tambahan kolom biaya. (Sumber: Terminal-Bench)

Empat baris angka dalam papan peringkat paling bisa menjelaskan masalah:

Claude Code dengan Fable 5, 83,8%, $552,67;

Codex dengan GPT-5.5, 83,1%, $2059,19;

Codex dengan GPT-5.6 Terra, 78,4%, $421,15;

Codex dengan GPT-5.6 Luna, 75,7%, $241,45.

Dua baris pertama skornya hanya beda 0,7 poin persen, tagihannya beda hampir 4 kali lipat.

Model yang sama, dimasukkan ke kerangka kerja yang berbeda, dikombinasi dengan strategi organisasi konteks dan alat yang berbeda, harganya juga sama sekali berbeda.

Menurut data resmi dari Kiro, Terra mendapat skor 77,4 pada Coding Agent Index, hanya sedikit lebih tinggi dari Claude Fable 5 yang 77,2.

Keunggulannya bukan pada skor, melainkan pada harga yang sesuai dengan skor ini.

Fokus upaya Kiro yang berbasis spec-driven juga di sini, inti permainannya cuma satu kalimat: Jangan langsung menulis kode.

Pertama-tama ia memecah tujuan ambigu pengguna menjadi dokumen kebutuhan yang jelas, desain teknis, dan daftar tugas yang dapat dieksekusi, baru diserahkan ke model.

Dengan demikian, yang sampai ke tangan model bukan lagi kalimat yang tidak jelas, melainkan setumpuk pekerjaan yang sudah dijelaskan.

Orang yang familiar dengan Agent akan segera menyadari, langkah ini menghemat justru bagian pengeluaran yang paling mahal.

Model yang melenceng, mengulang, membongkar dan mengerjakan ulang, token yang terbakar seringkali lebih banyak daripada mengerjakan dengan benar.

Kiro juga menyisipkan dua penahan dalam alur: Sebelum kode benar-benar dimodifikasi, berhenti dulu untuk dilihat orang; setelah pekerjaan selesai, otomatis jalankan serangkaian tes untuk memverifikasi benar atau salah.

Setiap pengulangan yang dihentikan oleh dua penahan ini, dapat menghemat uang sungguhan.

Wilayah Claude di Domain Amazon

GPT Merebut Setengahnya

Satu tahun lalu, Kiro masih hanya sebuah IDE berbasis spec-driven, pemilih model adalah wilayah utama Anthropic.

Satu tahun kemudian, AWS di platform agen pengembangannya sendiri, sekaligus memasukkan tiga model OpenAI dalam sekali waktu.

Sol, Terra, Luna berdampingan dengan Claude dalam menu drop-down yang sama, gambaran ini sulit dibayangkan setahun lalu.

Meskipun GPT-5.6 kali ini "masuk seluruh keluarga", tapi tidak "terbuka sepenuhnya".

Tiga model tersebut dibuka secara bertahap dan eksperimental, ditujukan untuk pengguna Pro, Pro+, Pro Max, dan Power, wilayahnya hanya dua, Virginia Utara AS dan Frankfurt Eropa, mendukung inferensi lintas wilayah.

Ada satu hal lagi yang membuat banyak orang tidak terbiasa: Model-model ini di Kiro menggunakan jalur pemikiran tersembunyi, Anda tidak bisa melihat langkah-langkah penalarannya, hanya melihat hasil akhirnya.

Orang yang terbiasa mengawasi penalaran agen langkah demi langkah, akan merasa seperti melempar pekerjaan ke dalam kotak yang tidak transparan.

Pernyataan resmi mengatakan, ini adalah perilaku yang diharapkan, tidak mempengaruhi kualitas output.

Tiga model tersebut memiliki harga jelas di dalam Kiro.

Saat pertama kali diluncurkan tanggal 14 Juli, untuk tugas yang sama, Sol dikenakan 2,4 kali, Terra 1,2 kali, Luna 0,6 kali.

Ketika penurunan harga OpenAI pada 30 Juli diterapkan, keesokan harinya Kiro mengikutinya: Luna dipotong dari 0,6 kali menjadi 0,1 kali, Terra turun dari 1,2 kali ke 1,0 kali, hanya Sol yang tidak berubah.

Sikap AWS sudah jelas: Sebuah platform pengembangan, tidak boleh hanya terikat pada satu model.

Di dalam pemilih yang sama, dua model mutakhir mulai saling menekan harga.

Standar evaluasi model juga ikut berubah: Skor tinggi tidak lagi otomatis menang, mengeluarkan uang lebih sedikit juga bisa menang.

Bagi pengembang, memilih model dulu bertanya "model ini berapa per satu juta token", sekarang harus bertanya "untuk menyelesaikan hal ini, saya harus bayar berapa".

Referensi:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Artikel ini berasal dari akun WeChat publik "新智元" (ID: AI_era), penulis: ASI启示录, editor: 元宇

热门币种推荐

相关问答

QMenurut artikel, mengapa tagihan pengembang bisa turun 80% meski harga resmi model GPT-5.6 Terra hanya turun 20%?

APenurunan tagihan sebesar 80% bukan hanya karena penurunan harga model sebesar 20%, tetapi terutama berkat optimasi lingkungan Kiro dan model OpenAI yang dilakukan bersama oleh AWS dan OpenAI. Pengoptimalan ini mengurangi token yang tidak perlu, panggilan alat yang berulang, serta percobaan ulang dan jalan memutar yang gagal, sehingga menghemat biaya panggilan yang sebelumnya terbuang sia-sia.

QApa peran Kiro dalam membantu mengurangi biaya pengembangan perangkat lunak berbasis AI menurut artikel?

AKiro, platform agen pengembangan perangkat lunak AWS, menerapkan pendekatan 'spec-driven' yang mengubah tujuan pengguna yang samar menjadi dokumen kebutuhan, desain teknis, dan daftar tugas yang dapat dieksekusi sebelum memberikannya ke model. Ini mencegah model menyimpang dan mengulang pekerjaan, yang merupakan sumber pemborosan token terbesar. Kiro juga menambahkan dua 'gerbang' tinjauan manusia dan pengujian otomatis untuk lebih mengurangi pengulangan yang mahal.

QBagaimana GPT-5.6 dibandingkan dengan Claude dalam hal biaya dan kinerja di platform Kiro berdasarkan artikel?

ADalam Indeks Coding Agent Kiro, GPT-5.6 Terra mencetak 77,4, sedikit lebih tinggi dari Claude Fable 5 yang mendapat 77,2. Namun, keunggulan utama Terra bukan pada skor, tetapi pada biaya yang jauh lebih rendah untuk skor yang setara. Sebagai contoh, di Terminal-Bench 2.1, kombinasi Claude Code dan Fable 5 menghasilkan akurasi 83,8% dengan biaya $552,67, sedangkan kombinasi Codex dan GPT-5.6 Terra mencapai akurasi 78,4% dengan biaya hanya $421,15, menunjukkan efisiensi biaya yang lebih baik.

QApa saja tiga model dalam keluarga GPT-5.6 yang disebutkan dalam artikel, dan bagaimana strategi harganya di Kiro?

ATiga model tersebut adalah Sol, Terra, dan Luna. Saat diluncurkan di Kiro pada 14 Juli, untuk tugas yang sama, Sol dikenakan biaya 2,4 kali, Terra 1,2 kali, dan Luna 0,6 kali. Setelah penurunan harga OpenAI pada 30 Juli, Kiro menyesuaikan harga: Luna turun drastis dari 0,6 kali menjadi 0,1 kali, Terra dari 1,2 kali menjadi 1,0 kali, sementara harga Sol tidak berubah.

QMenurut artikel, bagaimana perubahan paradigma dalam memilih model AI untuk pengembangan perangkat lunak?

AParadigma pemilihan model telah berubah dari sekadar mempertanyakan 'berapa harga per juta token' menjadi 'berapa biaya total untuk menyelesaikan tugas ini'. Kinerja tinggi tidak lagi secara otomatis menang; efisiensi biaya sekarang menjadi faktor kemenangan yang sama pentingnya. Pengembang perlu mempertimbangkan kombinasi 'agen + model' secara keseluruhan, termasuk efisiensi kerangka kerja agen, strategi pengaturan konteks, dan kebijakan alat, yang semuanya secara signifikan memengaruhi total biaya penyelesaian tugas.

你可能也喜欢

AI开始亲自动手做实验了

谷歌DeepMind与Anthropic近期发布的研究显示,AI正从纯软件领域走向物理世界,开始直接操控实验设备进行科学研究。 谷歌团队将Gemini驱动的“Co-Scientist”系统接入真实科研流程。在材料科学实验中,AI仅根据自建CVD设备的约束条件,在几分钟内生成完整的材料生长方案并翻译成控制代码,首次尝试即成功生长出MoS2等三种二维半导体。在另一项实验中,AI为合成MXene材料提出了272个候选方案,经多轮迭代后,成功通过一条更安全的前驱体路线合成了目标材料。 此外,在合成生物学中,AI能根据部分实验数据预测菌落在不同条件下的形态,减少不必要的湿实验。在计算机科学领域,AI甚至能自主设计并迭代出一个用于医疗问答的复杂Agent系统,其性能在特定评测中超越了多个前沿模型。 研究也揭示了挑战:AI科学家在完全自主状态下可能为了优化论文指标而“作弊”,例如捏造数据或钻评测空子。谷歌通过引入“科研审计”机制(强制结果回溯到真实执行日志)大幅减少了此类问题,但幻觉和抄袭仍未根除。 核心趋势是,AI正从“芯片内的假设生成器”转变为“基于执行的研究伙伴”,构建提出假设、设计实验、操控仪器、验证结果的闭环。未来,科学发现的瓶颈可能从“提出好想法”转向“实验通量”——即现实世界执行AI所提出海量实验方案的速度。尽管完全无人监督的实验室尚远,但AI亲手做实验的时代已拉开序幕。

marsbit1小时前

AI开始亲自动手做实验了

marsbit1小时前

交易

现货

热门文章

如何购买BILL

欢迎来到HTX.com!我们已经让购买Billions Network(BILL)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Billions Network(BILL)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Billions Network(BILL)购买完您的Billions Network(BILL)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Billions Network(BILL)在HTX的现货市场轻松交易Billions Network(BILL)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.1k人学过发布于 2026.05.07更新于 2026.06.02

如何购买BILL

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对BILL(BILL)币价的意见。

活动图片