Kali ini Claude benar-benar menciptakan jarak yang besar di papan peringkat pemrograman AI!
Tepat pada peringkat MirrorCode yang baru saja diperbarui, Claude Fable 5 kembali menduduki puncak dengan tingkat keberhasilan mutlak 64%.
GPT-5.6 Sol yang berada di posisi kedua, skornya hanya sepertiga dari Fable 5!
GPT-5.5 di posisi keempat bahkan lebih memprihatinkan. Tidak hanya nilainya hanya 10%, bahkan juga dikalahkan oleh pendahulunya sendiri, GPT-5.4.

Yang lebih mengejutkan adalah, saat menggunakan bahasa yang kaya sumber daya seperti Go, tingkat penyelesaian Fable 5 adalah 64%; ketika beralih ke bahasa yang kurang populer seperti Ada, nilainya tetap tinggi, mencapai 61%.
Perlu diketahui, di dunia sumber terbuka, korpus Python kira-kira 230 kali lebih banyak daripada Ada.
Tapi di tangan Fable 5, nilainya hanya turun 3 persen.

Ini menarik.
Jika model terutama mengandalkan hafalan sintaks dan penulisan umum bahasa populer, maka saat beralih ke Ada, nilainya seharusnya turun.
Namun hasil sekarang justru mengarah pada kemungkinan lain—
Model terkuat telah terbebas dari tarikan korpus bahasa tertentu, dan mulai belajar membangun proyek perangkat lunak lengkap dari nol.
Tersangkut di Batas Lulus 100%, Uji Batas 100 Miliar Token
Secara spesifik, MirrorCode lengkap berisi 25 program target, mencakup alat Unix, interpreter, query data, bioinformatika, kriptografi, dan alat kompresi.
Di sini, model ditempatkan di lingkungan terisolasi, tanpa internet, tidak dapat melihat kode sumber proyek asli, dan juga tidak dapat mengunduh dependensi pihak ketiga. Yang didapatkannya hanyalah dokumentasi tingkat tinggi, sebagian tes yang terlihat, dan program asli yang dapat dipanggil berulang kali.
Selanjutnya, ia harus terus memasukkan data ke program asli, mengamati output untuk menebak logika internal, lalu sedikit demi sedikit menulis program baru yang perilakunya konsisten.
Peringkat terbaru memilih 15 target Medium dan Large darinya. Setiap target menggunakan dua bahasa implementasi, setiap bahasa dijalankan tiga kali.
Dan, tingkat penyelesaian tes terlihat dan tes tersembunyi harus mencapai 100% untuk dinyatakan lulus, bahkan 99.9% tidak cukup.
Asalkan melewatkan satu kasus tepian, seluruh sesi tetap dihitung gagal.

Untuk memaksa model menutupi beberapa celah terakhir, MirrorCode mendorong anggaran per sesi ke 100 miliar Token, dengan durasi berjalan maksimal diperbolehkan selama 7 hari berturut-turut.
Dalam makalah, tugas dengan biaya tertinggi bahkan lebih ekstrem: model berjalan terus menerus selama 19 hari, dengan biaya per sesi mencapai 2.600 dolar AS.
Selama 19 hari ini, model akan berulang kali menjalankan program asli, membandingkan hasil, menambahkan fungsi, lalu menjalankan tes lagi. Jika error, cari penyebab; jika output tidak sesuai, ganti asumsi; jika bagian lokal berhasil, lanjut ke celah berikutnya.
Seluruh proses lebih menyerupai debugging yang berlangsung berhari-hari, bukan sekadar sekali pembangkitan.

Contoh gotree paling jelas.
Alat bioinformatika ini awalnya memiliki sekitar 16.000 baris kode Go dan lebih dari 40 perintah.
Claude Opus 4.7 menghabiskan 14 jam dan 251 dolar AS, lulus 2000 dari 2001 tes, dengan tingkat penyelesaian mencapai 99.95%.
Meskipun melewatkan satu kasus tepian yang jarang terkait penanganan komentar tanggal, sehingga tertahan oleh batas lulus 100% MirrorCode, ia telah memampatkan pekerjaan yang biasanya memakan waktu berminggu-minggu menjadi belasan jam—
Epoch memperkirakan, tanpa menggunakan AI, seorang insinyur manusia membutuhkan setidaknya 2 hingga 17 minggu untuk menyelesaikan tugas yang sama.
Di Gurun Korpus, Fable 5 Hanya Turun 3 Poin
Makalah MirrorCode pernah menggunakan campuran pelatihan terbuka StarCoder sebagai referensi.
Di dalamnya, Python menyumbang sekitar 8%, Ada hanya 0.034%, yang pertama kira-kira 230 kali lebih banyak daripada yang terakhir.

Tentu, kita tidak tahu pasti berapa banyak kode Ada yang telah dilihat model sumber tertutup. Tapi menggunakan ekosistem terbuka sebagai referensi, sudah cukup jelas betapa langkanya Ada.
Bahasa ini terutama muncul di sistem kedirgantaraan, pertahanan, dan sistem kritis keamanan lainnya. Baik skala komunitas, jumlah tutorial, maupun proyek sumber terbuka, jauh tidak sebanding dengan Python, JavaScript, atau Go.
Dan jelas Fable 5 bukan sekadar menerjemahkan kode Go baris demi baris ke Ada.
Ia lebih mirip pertama-tama memahami bagaimana program asli bekerja, lalu mengganti bahasa, dan membangun kembali perilaku yang sama.

Sebaliknya, model lain tidak se-stabil ini.
GPT-5.6 Sol turun dari 24% ke 19%, GPT-5.4 dari 21% ke 12%, GPT-5.5 bahkan dari 17% ke 5%. Begitu bahasa diganti, jarak langsung diperbesar.
Menyerahkan Seluruh Proyek pada AI
Saat ini, Cursor telah memungkinkan ratusan Agent berkolaborasi hampir seminggu, menulis dari nol lebih dari 1 juta baris kode browser yang tersebar di 1000 file.
Anthropic memungkinkan 16 Claude Agent berjalan paralel dalam hampir 2000 sesi, akhirnya membangun kompiler C sebesar 100.000 baris yang mampu mengompilasi kernel Linux 6.9.
Dalam sampel pengguna pribadi Codex yang diungkap OpenAI hingga Mei, 70,2% setidaknya pernah menyerahkan satu tugas yang diperkirakan memerlukan lebih dari satu jam kerja manusia; 25,6% menyerahkan tugas yang memerlukan lebih dari delapan jam.
Unit yang diserahkan orang kepada AI, sedang berubah dari sepotong kode, sebuah bug, menjadi setengah hari, seminggu, bahkan seluruh proyek.
Angka 64% dari MirrorCode adalah kuantifikasi terhadap "delegasi tingkat proyek" ini.
Ini menunjukkan, selama target cukup jelas dan hasil dapat diterima secara otomatis, model mutakhir sudah dapat menyelesaikan sebagian perangkat lunak menengah-besar secara independen.
Bagi setiap orang yang sedang menyerahkan pekerjaannya pada AI, perubahan sudah sangat dekat—
Dulu Anda perlu mengawasinya menulis setiap bagian kode, selanjutnya, Anda lebih mungkin hanya memeriksanya di titik kunci apakah ia menyimpang.
Kode akan semakin murah.
Dan mereka yang mampu menjelaskan masalah dengan jelas dan memverifikasi hasil dengan baik, akan semakin berharga.
Referensi: https://epoch.ai/MirrorCode
Artikel ini berasal dari akun WeChat publik "新智元", penulis: ASI启示录; editor: 摩西






