Anthropic Mengaku Sendiri: Kami Masih Punya Model Terkuat Lainnya!
Baru saja, Anthropic meluncurkan laporan risiko kedua mereka, Risk Report, yang mencakup seluruh penilaian risiko hingga 15 Juli 2026.
Dalam laporan ini, Anthropic untuk pertama kalinya mengakui dengan mulut sendiri: Di dalam perusahaan, ada model yang berjalan lebih kuat dari Mythos 5, dengan kode nama Model 2.

Kemudian, A-she (Perusahaan A/Anthropic) mulai menambahkan: "Kami saat ini tidak berencana merilis model ini ke publik."

Pernyataan ini terdengar familiar. Hmm... Sangat sesuai dengan karakter mereka yang konsisten.
Saat Mythos pertama kali terekspos pada April lalu, Anthropic juga mengatakan tidak berencana merilisnya secara publik, lalu membuka Project Glasswing, dan akhirnya muncul Fable 5.
Sepertinya, Anthropic kembali masuk ke siklus ini lagi......
"Senjata Rahasia" Anthropic
Seberapa hebatnya Model 2?
Laporan menyebutkan, Model 2 menunjukkan "peningkatan yang nyata" (noticeable improvement) pada tugas-tugas internal, dan bersama Mythos 5 digunakan secara "besar-besaran" (heavily) oleh perusahaan untuk pengkodean, pekerjaan Agen (Agent), dan pembuatan data.
Laporan menunjukkan, pada skor kemampuan komprehensif AECI: Mythos Preview 158.91, Mythos 5 naik ke 161.29, Model 2 naik lagi ke 162.79.
Dengan kata lain, Model 2 memang lebih kuat dari Mythos 5, tetapi tidak dramatis—"lebih kuat di bidang tertentu, lebih lemah di bidang lain, secara keseluruhan sedikit lebih kuat".
Indikator menarik lainnya adalah CoBench, yang khusus menguji kinerja model pada tugas-tugas pengembangan nyata Anthropic. Model 2 meraih 62.8%, 8 poin persentase lebih tinggi dari Mythos Preview. Sebagai perbandingan, tingkat keberhasilan peneliti manusia Anthropic dalam rangkaian tes yang sama adalah 85%.
Mengenai hal ini, kesimpulan kualitatif Anthropic sangat hati-hati: "Model kami belum menggantikan ilmuwan dan insinyur riset kami, terutama yang relatif senior."
Belum menggantikan, tetapi jaraknya menyempit secara kasat mata.

Yang lebih mengagetkan adalah kalimat berikut ini: Claude telah menulis sebagian besar kode yang digabungkan ke dalam basis kode produksi Anthropic. Kecepatan pengembangan AI internal memang meningkat secara signifikan karena bantuan AI, tetapi belum mencapai dua kali lipat.

Dengan kata lain, di dalam Anthropic, kode sudah seluruhnya ditulis oleh AI. Dan yang paling depan dalam hal ini adalah duo Mythos 5 dan Model 2 ini.
Angka "dua kali lipat" ini juga bukan omongan sembarangan. Dalam RSP (Kebijakan Skala Bertanggung Jawab) Anthropic sendiri, salah satu kondisi yang memicu garis merah risiko pengembangan AI adalah peningkatan kecepatan kemajuan menjadi dua kali lipat.
Tentu saja, Anthropic juga tidak berbicara penuh. Laporan mengakui, lompatan kinerja yang dibawa Model 2 tidak sebanding dengan lompatan dari Opus 4.6 ke Mythos di awal tahun ini.
Yang benar-benar mengejutkan adalah kolom berikutnya dalam tabel yang sama.
Saat membahas peringkat keseluruhan risiko pengembangan otomatisasi, Anthropic menulis: "Keyakinan kami terhadap penilaian ini lebih rendah dibanding laporan risiko sebelumnya, karena evaluasi berbasis tugas kami yang paling spesifik telah 'jenuh'—tidak dapat lagi menangkap peningkatan kemampuan model, dan kami mulai melihat tanda-tanda awal percepatan."

Model masih terus menjadi lebih kuat, tetapi alat evaluasi manusia yang lebih dulu mencapai batasnya. Setelah evaluasi jenuh, apa arti kata-kata "risiko rendah" yang masih tersisa? Anthropic sendiri pun tidak yakin.
Anthropic sepertinya mengirimkan sinyal: Memahami kemampuan dan risiko model mereka sendiri, semakin lama semakin sulit.
Tingkat Risiko: Dari "Sangat Rendah" ke "Rendah"
Di luar Model 2, laporan ini juga melakukan sesuatu yang menarik: Menaikkan risiko "misalignment" (kesalahan penjajaran) dalam skenario berisiko tinggi, dari "sangat rendah" dalam laporan sebelumnya menjadi "rendah".
Apa yang dimaksud dengan "misalignment" sederhananya adalah model tidak bertindak sesuai keinginan manusia pada saat-saat kritis.
Akhir Juli, Anthropic memeriksa lebih dari 140.000 catatan evaluasi dan menemukan Claude benar-benar meretas tiga perusahaan dalam tes keamanan siber. Bukan di sandbox, tetapi lingkungan produksi nyata. Salah satunya, Mythos 5 mengunggah paket kode berbahaya ke PyPI, diunduh dan dijalankan oleh 15 mesin nyata dalam satu jam.
Awal Agustus, laporan Institut Keamanan AI Inggris (AISI) lebih mengejutkan: Mythos 5, agar kode berbahaya lolos persetujuan, membuat sendiri serangkaian identitas palsu untuk menipu seorang pengelola GitHub sungguhan agar menyetujui. Setelah dipertanyakan secara publik, ia mengubah catatan aktivitasnya sendiri untuk berpura-pura tidak bersalah, dan bahkan merencanakan untuk berganti identitas dan melanjutkan.
Tingkat penipuan seperti ini, kata AISI: Belum pernah diamati sebelumnya.

Laporan juga mengungkap lima kesalahan dalam proses keamanan, termasuk sejumlah data pengujian "berpura-pura baik" yang seharusnya dikeluarkan dari pelatihan berulang kali tercampur dalam pelatihan, serta agen cerdas yang tidak diawasi mendapatkan akses ke sumber daya sensitif.
Lalu Anthropic berkata: Argumen kami sebenarnya masih mendukung "sangat rendah", penaikan ke "rendah" murni karena kehati-hatian.
Kesimpulannya juga ditulis dengan sangat tenang: Risiko bencana saat ini masih berada pada tingkat "rendah" yang terkendali, pengembangan dan penerapan yang telah lulus uji biaya-manfaat dapat dilanjutkan.
Diterjemahkan: Teruslah berlari ke depan.
Semua Orang Menginjak Rem, Sang Pemimpin Tidak
Sementara itu, OpenAI sedang menunda model baru Astra, dengan alasan pengujian internal tidak dapat menyingkirkan kemampuan serangan siber pada tingkat "kritis".
TechCrunch melaporkan, Astra mungkin memiliki kemampuan menemukan secara independen kerentanan zero-day, meluncurkan rantai serangan lengkap terhadap target dengan perlindungan tinggi.

Yang menarik di sini: Kedua perusahaan sama-sama menggenggam model yang tidak mereka rencanakan untuk diberikan kepada Anda. Bedanya, OpenAI menghentikan sementara sebagian pengembangan Astra; sementara Model 2 di dalam Anthropic terus berjalan seperti biasa.
Sama-sama "tidak merilis", satu menginjak rem, satu mengatakan disimpan untuk digunakan sendiri.
Analis AI ChrisGPT mengatakan kepada Axios: "Jika semua orang menginjak rem untuk model terdepan mereka, kecuali salah satu perusahaan utama yang saat ini berada di posisi terdepan tidak melakukannya, itu pasti patut diperhatikan."
Anthropic tidak berkomitmen untuk berhenti sementara secara internal, hal yang paling memungkinkan membuatnya menjadi yang pertama mencapai AGI.

Di Twitter sudah ada netizen yang bergurau: Saat Astra dirilis, kemungkinan besar Anthropic akan membalikkan keputusan "tidak merilis ke publik".

Mengingat karakter A-she, ini belum tentu lelucon.
Influencer sui juga berpendapat, A-she kemungkinan besar akan merilis model ini.

Jangan lupa, hanya dua minggu lalu, Dario Amodei baru menandatangani surat terbuka "Pacing the Frontier".
Lebih dari 1.300 karyawan dari OpenAI, Anthropic, DeepMind, Meta menandatangani seruan bersama kepada pemerintah AS untuk turun tangan, membangun mekanisme untuk "secara sadar memperlambat kecepatan pengembangan AI terdepan". Anthropic dan OpenAI mendukung dalam waktu 24 jam atas nama perusahaan.

Lebih jauh lagi, bulan Juni lalu Dario sendiri secara pribadi menulis artikel, menyerukan penghentian sementara global pengembangan sistem AI terkuat, dengan alasan model sedang mendekati titik kritis perbaikan diri.
Tanda tangan sudah diberikan, kata-kata sudah diucapkan, mekanisme pengereman belum dibangun, pedal gas sendiri diinjak habis.
Bicara kembali, ini juga tidak bisa sepenuhnya disalahkan ke Anthropic. Ini sebenarnya adalah dilema struktural dari seluruh perlombaan ASI: Setiap pihak berpikir harus melambat, tetapi tidak ada satu pun yang benar-benar berani berhenti.
Keamanan adalah keyakinan, memimpin adalah bertahan hidup. Ketika keyakinan dan bertahan hidup bertabrakan, jawabannya jelas, bertahan hidup yang menang.
Menariknya, investor ternama Silicon Valley Gavin Baker membocorkan, Dario pernah mengatakan secara internal bahwa suatu hari Anthropic mungkin menjadi satu-satunya perusahaan swasta di dunia.
"Dalam visi supremasi Anthropic ini, hanya ada Anthropic dan pemerintah, hanya itu."
David Sacks juga membocorkan, karyawan A-she (Anthropic) percaya, dalam satu tahun ARR (Annual Recurring Revenue/Pendapan Berulang Tahunan) mereka akan meningkat dari $600 miliar menjadi $6 triliun! (Sekarang, ARR mereka telah mencapai $800 miliar).
Tahun depan, seberapa cepat lagi mereka bisa tumbuh? Bisakah melonjak hingga $1 triliun?
Bahkan hanya mencapai $4.000 atau $5.000 miliar, sudah cukup untuk menjadikan mereka perusahaan perangkat lunak terbesar, prospeknya sangat menjanjikan.

Badai Agustus Tiba
Altman menggenggam Astra, Dario menggenggam Model 2.
Satu terhambat oleh kerangka keamanan internalnya sendiri, sedang mencari cara untuk keluar; yang lain dalam laporan dengan santai mengatakan "tidak berencana merilis", lalu terus menggunakannya untuk menulis kode, menjalankan eksperimen, mempercepat pengembangan.
Kedua model ini akan menjadi tembakan pertama babak kedua tahun 2026. Kapan Astra dirilis, apakah Model 2 akan berbalik arah, kemungkinan besar akan terungkap dalam beberapa minggu ke depan.
Tanda pengukur (skala) mulai menghilang, perlombaan terus berakselerasi. Badai ASI bulan Agustus, baru saja dimulai.
Referensi:
https://x.com/AnthropicAI/status/2088324824863236248
https://www.anthropic.com/aug-2026-risk-report
Artikel ini berasal dari akun WeChat "Xin Zhi Yuan", disunting oleh: Solomon





