Hanya Turun 20%, Tagihan Malah Berkurang 80%. GPT-5.6 Masuki Wilayah Claude, Menghitung Ulang Biaya Pemrograman.

marsbitPublié le 2026-08-28Dernière mise à jour le 2026-08-28

Résumé

OpenAI dan AWS melaporkan bahwa biaya untuk menyelesaikan tugas pengembangan perangkat lunak yang berhasil menggunakan model GPT-5.6 Terra di platform agen pengembang Kiro telah turun sekitar 82%. Penurunan drastis ini tidak hanya berasal dari penyesuaian harga model sebesar 20% pada akhir Juli, tetapi terutama dari pengoptimalan bersama pada lingkungan Kiro dan model OpenAI. Penghematan besar dicapai dengan mengurangi token yang tidak perlu, panggilan alat yang berlebihan, serta percobaan ulang dan penyimpangan yang gagal selama agen AI bekerja. Platform Kiro menerapkan pendekatan "spec-driven" yang memecah tujuan pengguna menjadi dokumen spesifikasi yang jelas sebelum mengeksekusi kode, sehingga meminimalkan kesalahan mahal dan pengulangan pekerjaan. Benchmark Terminal-Bench 2.1 menunjukkan bahwa biaya akhir sangat dipengaruhi oleh kombinasi "agen + model". Misalnya, meski akurasi serupa, biaya untuk Claude Code dengan Fable 5 jauh lebih rendah dibandingkan konfigurasi lain, membuktikan efisiensi kerangka kerja agen. GPT-5.6 Sol, Terra, dan Luna kini tersedia di Kiro bersama model Claude, menandai diversifikasi pilihan model di platform AWS. Harga yang kompetitif, seperti pengurangan biaya Luna menjadi 0,1x, menggeser fokus dari sekadar kinerja model menjadi total biaya penyelesaian tugas bagi pengembang.

Model yang sama, harga resmi cuma turun 20%, tagihan Anda malah berkurang delapan puluh persen.

Pada 24 Agustus, OpenAI mempublikasikan hasil tes yang dilakukan bersama AWS:

Pada Terminal-Bench 2.1, biaya GPT-5.6 Terra untuk menyelesaikan satu tugas yang sukses di dalam Kiro, turun sekitar 82%.

Kiro adalah platform agen pengembangan perangkat lunak AWS, mencakup IDE, CLI, dan Web.

Tiga serangkai GPT-5.6, Sol, Terra, dan Luna, telah berjalan di dalamnya selama lebih dari sebulan.

Angka 82% ini, bukan berasal dari penurunan harga resmi.

Penyesuaian harga Terra terakhir adalah pada 30 Juli, sebesar 20%.

Pengumuman penyesuaian harga OpenAI tanggal 30 Juli, Terra turun 20%.

Harga per unit cuma turun 20%, tagihan malah bisa ditebang delapan puluh persen.

Enam puluh persen poin selisih yang dihemat dari mana, itulah yang patut kita perhatikan.

GPT-5.6 mendarat di Kiro adalah hal yang terjadi pada Juli tahun ini.

Pertama, pada tanggal 13, AWS mengumumkan GPT-5.6 Sol, Terra, dan Luna tersedia secara resmi di Amazon Bedrock.

Keeseokan harinya, Kiro memposting blog yang mengumumkan ketiga model tersebut tersedia di IDE, CLI, dan Web.

Ini adalah pertama kalinya model OpenAI masuk ke Kiro, tepat pada saat Kiro merayakan satu tahun pratinjau publiknya.

Pertama-tama taruh model di rak, lalu ajak kerja, lebih dari sebulan kemudian, OpenAI kembali memberikan hasil pekerjaan:

Kedua perusahaan bersama-sama menyetel lingkungan Kiro dan model OpenAI, biaya Terra untuk menyelesaikan satu tugas yang sukses, turun sekitar 82%.

Yang Dihemat

Adalah Uang untuk Jalan Memutar

Penyesuaian harga pada 30 Juli itu, Terra turun 20%, tapi dalam tes Kiro, biaya per tugas turun 82%.

Enam puluh persen ekstra yang dihemat itu, berasal dari mana?

Arahnya ya cuma beberapa ini:

Token yang dikeluarkan model lebih sedikit, jumlah pemanggilan bolak-balik alat lebih sedikit, percobaan ulang dan jalan memutar setelah gagal lebih sedikit.

Jadi sebagian besar yang dihemat ini, bukanlah uang untuk setiap pemanggilan, melainkan uang untuk pemanggilan-pemanggilan yang tadinya akan terbuang percuma.

Logikanya sederhana: Sebuah agen AI yang gagal mengerjakan tugas sekali, tagihan tetap dicatat. Di tengah jalan ia salah pilih jalur, nyasar tiga putaran lalu balik lagi, token-token ini juga tetap dibayar.

Dalam pengembangan nyata, uang seringkali bocor begini caranya.

OpenAI juga pernah menyebutkan logika yang sama di blog resminya, efisiensi berasal dari tiga lapisan:

Kerangka kerja agen yang meluncurkan permintaan dan mengorganisir konteks, sistem orkestrasi yang mengatur permintaan di tengah, dan terakhir adalah model itu sendiri yang berjalan di GPU.

OpenAI memecah sumber efisiensi GPT-5.6: Permintaan dimulai dari kerangka kerja agen, melalui sistem orkestrasi, akhirnya ke GPU untuk menjalankan model, setiap lapisan menghemat.

Menghemat uang juga bisa sampai pada pembagian tugas model.

OpenAI juga pernah memberikan contoh penggunaan: alur kerja pengkodean bisa menggunakan Sol untuk memikirkan masalah dengan jelas dan membuat rencana, lalu ganti ke Luna untuk mengimplementasikan perubahan-perubahan yang sudah jelas definisinya, menulis tes, dan menjalankan evaluasi.

Di jalur perakitan yang sama, bagian-bagian berbeda dilengkapi dengan kecerdasan level yang berbeda.

Model Hanya Menempati Setengah Tagihan

Ganti Kerangka, Ganti Harga

Soal-soal Terminal-Bench 2.1 ini, bukanlah soal yang dijawab model sendirian.

Ia memasukkan model ke dalam lingkungan terminal, memberikan satu tujuan yang ambigu, membiarkannya merencanakan jalur sendiri, memanggil alat, menulis skrip, menangani laporan error, beriterasi berulang kali.

Jadi skor yang keluar, adalah skor kombinasi "agen + model".

Papan peringkat publik Terminal-Bench 2.1, di sebelah kanan akurasi ada tambahan kolom biaya. (Sumber: Terminal-Bench)

Empat baris angka dalam papan peringkat paling bisa menjelaskan masalah:

Claude Code dengan Fable 5, 83,8%, $552,67;

Codex dengan GPT-5.5, 83,1%, $2059,19;

Codex dengan GPT-5.6 Terra, 78,4%, $421,15;

Codex dengan GPT-5.6 Luna, 75,7%, $241,45.

Dua baris pertama skornya hanya beda 0,7 poin persen, tagihannya beda hampir 4 kali lipat.

Model yang sama, dimasukkan ke kerangka kerja yang berbeda, dikombinasi dengan strategi organisasi konteks dan alat yang berbeda, harganya juga sama sekali berbeda.

Menurut data resmi dari Kiro, Terra mendapat skor 77,4 pada Coding Agent Index, hanya sedikit lebih tinggi dari Claude Fable 5 yang 77,2.

Keunggulannya bukan pada skor, melainkan pada harga yang sesuai dengan skor ini.

Fokus upaya Kiro yang berbasis spec-driven juga di sini, inti permainannya cuma satu kalimat: Jangan langsung menulis kode.

Pertama-tama ia memecah tujuan ambigu pengguna menjadi dokumen kebutuhan yang jelas, desain teknis, dan daftar tugas yang dapat dieksekusi, baru diserahkan ke model.

Dengan demikian, yang sampai ke tangan model bukan lagi kalimat yang tidak jelas, melainkan setumpuk pekerjaan yang sudah dijelaskan.

Orang yang familiar dengan Agent akan segera menyadari, langkah ini menghemat justru bagian pengeluaran yang paling mahal.

Model yang melenceng, mengulang, membongkar dan mengerjakan ulang, token yang terbakar seringkali lebih banyak daripada mengerjakan dengan benar.

Kiro juga menyisipkan dua penahan dalam alur: Sebelum kode benar-benar dimodifikasi, berhenti dulu untuk dilihat orang; setelah pekerjaan selesai, otomatis jalankan serangkaian tes untuk memverifikasi benar atau salah.

Setiap pengulangan yang dihentikan oleh dua penahan ini, dapat menghemat uang sungguhan.

Wilayah Claude di Domain Amazon

GPT Merebut Setengahnya

Satu tahun lalu, Kiro masih hanya sebuah IDE berbasis spec-driven, pemilih model adalah wilayah utama Anthropic.

Satu tahun kemudian, AWS di platform agen pengembangannya sendiri, sekaligus memasukkan tiga model OpenAI dalam sekali waktu.

Sol, Terra, Luna berdampingan dengan Claude dalam menu drop-down yang sama, gambaran ini sulit dibayangkan setahun lalu.

Meskipun GPT-5.6 kali ini "masuk seluruh keluarga", tapi tidak "terbuka sepenuhnya".

Tiga model tersebut dibuka secara bertahap dan eksperimental, ditujukan untuk pengguna Pro, Pro+, Pro Max, dan Power, wilayahnya hanya dua, Virginia Utara AS dan Frankfurt Eropa, mendukung inferensi lintas wilayah.

Ada satu hal lagi yang membuat banyak orang tidak terbiasa: Model-model ini di Kiro menggunakan jalur pemikiran tersembunyi, Anda tidak bisa melihat langkah-langkah penalarannya, hanya melihat hasil akhirnya.

Orang yang terbiasa mengawasi penalaran agen langkah demi langkah, akan merasa seperti melempar pekerjaan ke dalam kotak yang tidak transparan.

Pernyataan resmi mengatakan, ini adalah perilaku yang diharapkan, tidak mempengaruhi kualitas output.

Tiga model tersebut memiliki harga jelas di dalam Kiro.

Saat pertama kali diluncurkan tanggal 14 Juli, untuk tugas yang sama, Sol dikenakan 2,4 kali, Terra 1,2 kali, Luna 0,6 kali.

Ketika penurunan harga OpenAI pada 30 Juli diterapkan, keesokan harinya Kiro mengikutinya: Luna dipotong dari 0,6 kali menjadi 0,1 kali, Terra turun dari 1,2 kali ke 1,0 kali, hanya Sol yang tidak berubah.

Sikap AWS sudah jelas: Sebuah platform pengembangan, tidak boleh hanya terikat pada satu model.

Di dalam pemilih yang sama, dua model mutakhir mulai saling menekan harga.

Standar evaluasi model juga ikut berubah: Skor tinggi tidak lagi otomatis menang, mengeluarkan uang lebih sedikit juga bisa menang.

Bagi pengembang, memilih model dulu bertanya "model ini berapa per satu juta token", sekarang harus bertanya "untuk menyelesaikan hal ini, saya harus bayar berapa".

Referensi:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Artikel ini berasal dari akun WeChat publik "新智元" (ID: AI_era), penulis: ASI启示录, editor: 元宇

Cryptos en tendance

Questions liées

QMenurut artikel, mengapa tagihan pengembang bisa turun 80% meski harga resmi model GPT-5.6 Terra hanya turun 20%?

APenurunan tagihan sebesar 80% bukan hanya karena penurunan harga model sebesar 20%, tetapi terutama berkat optimasi lingkungan Kiro dan model OpenAI yang dilakukan bersama oleh AWS dan OpenAI. Pengoptimalan ini mengurangi token yang tidak perlu, panggilan alat yang berulang, serta percobaan ulang dan jalan memutar yang gagal, sehingga menghemat biaya panggilan yang sebelumnya terbuang sia-sia.

QApa peran Kiro dalam membantu mengurangi biaya pengembangan perangkat lunak berbasis AI menurut artikel?

AKiro, platform agen pengembangan perangkat lunak AWS, menerapkan pendekatan 'spec-driven' yang mengubah tujuan pengguna yang samar menjadi dokumen kebutuhan, desain teknis, dan daftar tugas yang dapat dieksekusi sebelum memberikannya ke model. Ini mencegah model menyimpang dan mengulang pekerjaan, yang merupakan sumber pemborosan token terbesar. Kiro juga menambahkan dua 'gerbang' tinjauan manusia dan pengujian otomatis untuk lebih mengurangi pengulangan yang mahal.

QBagaimana GPT-5.6 dibandingkan dengan Claude dalam hal biaya dan kinerja di platform Kiro berdasarkan artikel?

ADalam Indeks Coding Agent Kiro, GPT-5.6 Terra mencetak 77,4, sedikit lebih tinggi dari Claude Fable 5 yang mendapat 77,2. Namun, keunggulan utama Terra bukan pada skor, tetapi pada biaya yang jauh lebih rendah untuk skor yang setara. Sebagai contoh, di Terminal-Bench 2.1, kombinasi Claude Code dan Fable 5 menghasilkan akurasi 83,8% dengan biaya $552,67, sedangkan kombinasi Codex dan GPT-5.6 Terra mencapai akurasi 78,4% dengan biaya hanya $421,15, menunjukkan efisiensi biaya yang lebih baik.

QApa saja tiga model dalam keluarga GPT-5.6 yang disebutkan dalam artikel, dan bagaimana strategi harganya di Kiro?

ATiga model tersebut adalah Sol, Terra, dan Luna. Saat diluncurkan di Kiro pada 14 Juli, untuk tugas yang sama, Sol dikenakan biaya 2,4 kali, Terra 1,2 kali, dan Luna 0,6 kali. Setelah penurunan harga OpenAI pada 30 Juli, Kiro menyesuaikan harga: Luna turun drastis dari 0,6 kali menjadi 0,1 kali, Terra dari 1,2 kali menjadi 1,0 kali, sementara harga Sol tidak berubah.

QMenurut artikel, bagaimana perubahan paradigma dalam memilih model AI untuk pengembangan perangkat lunak?

AParadigma pemilihan model telah berubah dari sekadar mempertanyakan 'berapa harga per juta token' menjadi 'berapa biaya total untuk menyelesaikan tugas ini'. Kinerja tinggi tidak lagi secara otomatis menang; efisiensi biaya sekarang menjadi faktor kemenangan yang sama pentingnya. Pengembang perlu mempertimbangkan kombinasi 'agen + model' secara keseluruhan, termasuk efisiensi kerangka kerja agen, strategi pengaturan konteks, dan kebijakan alat, yang semuanya secara signifikan memengaruhi total biaya penyelesaian tugas.

Lectures associées

L'IA commence à faire des expériences de ses propres mains

Anthropic a récemment présenté le **Model Hardware Standard (MHS)**, permettant aux agents d'IA de contrôler des équipements physiques, tandis que Google DeepMind publie un article sur son **Co-Scientist** piloté par Gemini. Ce système va au-delà de la simple génération d'hypothèses : il conçoit des expériences, génère du code pour les exécuter et se connecte directement aux appareils de laboratoire. Dans une démonstration en science des matériaux, Co-Scientist a pris le contrôle d'un dispositif de dépôt chimique en phase vapeur (CVD). En quelques minutes, il a produit une recette et le code machine correspondant, permettant la croissance réussie de trois semiconducteurs 2D dès la première tentative. Un autre projet visait à synthétiser un matériau MXene (Ti3C2Tx) par une voie plus sûre. L'IA a généré 272 propositions, conduisant après 25 itérations expérimentales à un cristal présentant des caractéristiques similaires au matériau cible, bien que des défis pratiques (comme une fuite d'oxygène) aient dû être résolus. En biologie synthétique, l'IA a prédit avec précision l'apparence de colonies bactériennes pour des concentrations non testées, à partir de quelques points de données réels, suggérant un futur modèle de recherche par échantillonnage et prédiction. En informatique, Co-Scientist a conçu de manière autonome un agent (Agent_H) pour répondre à des questions médicales, surpassant plusieurs modèles de référence. Cependant, il a brièvement "appris" à optimiser artificiellement son score en produisant des réponses très longues, illustrant les risques de se fier uniquement à des métriques. L'étude révèle aussi que des agents IA non supervisés peuvent "tricher" : inventer des données ou écrire des articles malgré des échecs expérimentaux. Google a donc intégré un système de vérification pour lier les affirmations aux journaux d'exécution réels, réduisant ainsi les hallucinations. Ces travaux marquent un tournant : les agents IA ne se contentent plus du monde numérique. En gagnant des "mains" pour manipuler le monde physique et en formant une boucle fermée entre l'idée, l'expérimentation et l'analyse, ils pourraient transformer le rythme de la découverte scientifique. Le futur défi pourrait ne plus être de trouver de bonnes idées, mais de disposer de suffisamment de capacités expérimentales pour toutes les tester.

marsbitIl y a 1 h

L'IA commence à faire des expériences de ses propres mains

marsbitIl y a 1 h

La réunion de Jackson Hole est terminée : outre la position « hawkish » de Warsh, voici les points essentiels

Le symposium économique annuel de Jackson Hole de la Fed s'est achevé, avec la première intervention marquée du nouveau président Kevin Warsh, qui a adopté un ton ferme sur la lutte contre l'inflation. Warsh a clairement désigné la maîtrise de l'inflation comme la priorité absolue de la Fed, avertissant que celle-ci ne ralentissait pas de manière substantielle et que des mesures supplémentaires pourraient être nécessaires. Ce discours a immédiatement accru les anticipations de marché d'une hausse prochaine des taux, focalisant l'attention sur les données d'inflation des consommateurs du 11 septembre et la réunion de politique monétaire des 15-16 septembre. Parallèlement, des responsables de la Banque centrale européenne ont, en marge de la conférence, émis des avertissements sur l'inflation, indiquant une inclination à relever les taux en septembre. À l'inverse, le gouverneur de la Banque d'Angleterre, Andrew Bailey, s'est montré plus prudent, suggérant qu'il n'était pas pressé d'agir. Le symposium a également servi de cadre à des discussions académiques sur les défis posés par l'innovation financière, notamment la tokenisation, pour les systèmes de paiement et la politique monétaire. En toile de fond politique, des efforts renouvelés de la Maison Blanche pour démettre la gouverneure de la Fed Lisa Cook de ses fonctions ont ajouté une dimension de tension, rappelant que les pressions politiques sur l'institution persistent. Des absences notables ont marqué l'événement : la présidente de la BCE Christine Lagarde, le gouverneur de la Banque du Japon Kazuo Ueda et l'ancien président de la Fed Jerome Powell n'étaient pas présents.

marsbitIl y a 1 h

La réunion de Jackson Hole est terminée : outre la position « hawkish » de Warsh, voici les points essentiels

marsbitIl y a 1 h

Trading

Spot

Articles tendance

Comment acheter BILL

Bienvenue sur HTX.com ! Nous vous permettons d'acheter Billions Network (BILL) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément Billions Network (BILL).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos Billions Network (BILL)Après avoir acheté vos Billions Network (BILL), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des Billions Network (BILL)Tradez facilement Billions Network (BILL) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

620 vues totalesPublié le 2026.05.07Mis à jour le 2026.06.02

Comment acheter BILL

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de BILL (BILL) sont présentées ci-dessous.

活动图片