OpenAI Pecahkan 10 Masalah Matematika dalam Seketika, Fable 'Replikasi' 5 di Antaranya dalam 24 Jam

marsbitDipublikasikan tanggal 2026-08-05Terakhir diperbarui pada 2026-08-05

Abstrak

OpenAI dan Anthropic bersaing ketat di garis depan matematika. OpenAI mengumumkan bahwa model utama mereka yang belum dirilis, Astra, telah membuktikan 10 hasil matematika terbuka, menyediakan sertifikat Lean dan analisis langkah demi langkah. Meski bukan masalah terdalam, masalah-masalah ini dianggap sangat sulit dan beberapa bahkan dapat dipublikasikan di jurnal top. Hanya dalam 24 jam, peneliti Anthropic, Levent Alpöge, mengklaim bahwa model publik mereka, Fable, secara independen membuktikan 5 dari 10 masalah yang sama dalam kondisi yang terkendali dan tanpa akses internet. Kecepatan ini secara drastis memperpendek "masa berlaku" klaim pertama dalam matematika. OpenAI menyatakan biaya menemukan 10 solusi ini kurang dari $2000, namun ini hanya mencakup biaya inferensi marginal, bukan biaya pelatihan model dan upaya manusia untuk formalisasi dan tinjauan. Fenomena ini lebih dari sekadar peringkat; ini seperti tinjauan sejawat karena dua model mencapai kesimpulan yang sama secara independen. Namun, pentingnya hasil ini sulit dipahami publik, mengandalkan rantai kepercayaan kepada para ahli. Ketika AI dapat memproduksi bukti secara massal dan murah, kemampuan paling langka bergeser dari "membuat bukti" menjadi "memahami dan memvalidasi bukti".

10 masalah matematika, dibalik dalam 24 jam.

Akhir pekan ini, dua raksasa AI, OpenAI dan Anthropic, beradu langsung di garis depan matematika.

Pertama, pada 1 Agustus, peneliti OpenAI Sébastien Bubeck mengumumkan bahwa model andalan generasi berikutnya mereka yang belum dirilis, Astra, berhasil membuktikan 10 capaian matematika terdepan sekaligus, lengkap dengan 10 sertifikat Lean dan 10 analisis pemecahan masalah per soal.

Jangan remehkan 10 masalah ini.

Kesimpulan utama mereka setidaknya sudah 10 tahun tidak mengalami kemajuan, banyak yang tertahan selama puluhan tahun, benar-benar masalah terbuka yang sulit.

Meski bukan termasuk misteri tak terpecahkan paling dalam dalam matematika, masing-masing adalah tantangan berat yang sulit dipecahkan.

Kepala FrontierMath di bawah Epoch AI, Elliot Glazer, dengan tegas mengatakan: hanya makalah tentang keberadaan grup non-Sofic ini saja, pasti akan masuk jurnal top yang diakui komunitas matematika, Annals of Mathematics.

Begitu 10 masalah sulit ini diumumkan, komunitas AI langsung heboh, ada yang langsung berseru "singularitas matematika telah tiba".

Anthropic dengan cepat merespons.

Kurang dari 24 jam, peneliti Levent Alpöge membalas postingan Bubeck dengan kalimat: "Saya menggunakan Fable menyelesaikan setengahnya."

Kemudian dia menambahkan, yang berhasil dia selesaikan adalah item ke-4, 5, 6, 7, 8 dalam daftar OpenAI, total 5 item.

Syarat eksperimen, menurut Levent, sangat bersih: sepenuhnya mandiri, prompt umum, tanpa koneksi internet selama proses, bahkan sengaja ditambahkan lapisan perlindungan untuk mencegah solusi OpenAI bocor ke dalam konteks.

Tentu saja, Levent saat ini belum merilis detail lengkap pembuktian Fable, dia mengatakan akan mengunggahnya.

Tetapi jika terbukti, bobot peristiwa ini berubah:

Keunggulan pertama yang diraih OpenAI dengan model belum dirilis Astra, hanya bertahan 24 jam. Sedangkan Fable yang mengejar, adalah model yang sudah lama dipublikasikan Anthropic dan dapat diakses semua orang.

Sebuah "Perdana Matematika", Masa Berlaku Hanya 24 Jam

Pengguna Chubby men-tweet ulang: "Fable yang tersedia secara publik, mereplikasi setengah pencapaian Astra."

Di kolom komentar ada yang bercanda: dilihat begini, apakah OpenAI hanya mendapatkan hak perdana?

Dulu, persaingan prioritas atas suatu pencapaian matematika, biasanya diukur dalam satuan tahun.

Siapa yang pertama memikirkan, siapa yang pertama membuktikan, siapa yang pertama mempublikasikan, di antaranya terdapat proses pengiriman, peninjauan, revisi yang panjang.

Namun sekarang, Astra bahkan belum resmi dirilis, pencapaian yang diumumkannya, hanya dalam 24 jam, sudah dikejar setengahnya oleh model publik.

Nilai keunggulan pertama masih ada, tetapi masa berlakunya jauh lebih singkat.

Banyak netizen sudah berteriak "singularitas matematika", dua raksasa AI juga saling mengikuti dengan ketat.

Di Balik 2000 Dolar, Ada Perhitungan yang Lebih Mahal

OpenAI juga melemparkan sebuah angka: biaya menemukan 10 solusi ini, kurang dari 2000 dolar.

Menurut peneliti Noam Brown, angka itu sesuai dengan token yang dibutuhkan untuk mencari solusi-solusi ini, kemudian dikonversi berdasarkan harga Sol API.

Artinya, ini hanya biaya inferensi marginal pada saat 10 solusi berhasil dijalankan.

Di luar itu, masih ada pelatihan dan pengembangan Astra itu sendiri, masalah-masalah yang dicoba tetapi tidak berhasil, jam kerja manusia dalam menyusun argumen menjadi makalah 249 halaman, biaya memformalkan setiap pembuktian ke dalam Lean, serta biaya peninjauan akhir oleh matematikawan eksternal.

Noam sendiri mengakui, mereka juga mencoba masalah-masalah besar lainnya, tetapi tidak berhasil, tidak satu pun masalah Hadiah Milenium yang berhasil dipecahkan.

Meski begitu, 2000 dolar tetap menekan biaya marginal AI untuk memecahkan satu masalah matematika terdepan, ke lantai paling bawah.

Bahkan ada yang bercanda, apakah OpenAI besok akan mengumumkan 10 terobosan matematika lagi, atau minggu depan langsung mengeluarkan 100 item sekaligus.

Dari "Saling Peringkat" ke "Saling Verifikasi"

Fable mengulang soal yang sama dengan Astra, hal ini jauh lebih menarik daripada sekadar saling meningkatkan peringkat.

Peningkatan peringkat mengukur jawaban yang sudah diketahui: soal dan jawaban standar sudah ada di sana, siapa yang nilainya lebih tinggi.

Sedangkan dua model dalam kondisi tanpa jaringan, anti bocor, masing-masing secara independen mencapai kesimpulan terdepan yang sama, mengukur sesuatu yang sama sekali berbeda: apakah hasil ini benar-benar dapat diandalkan, dapat direplikasi secara independen.

Ini lebih mirip peninjauan sejawat.

Levent saat ini hanya "membuat pernyataan" di X, belum merilis PDF, prompt, log eksekusi lengkap, biaya token, atau sertifikat Lean dari 5 pembuktian tersebut.

Netizen Haider mempertanyakan: kalaupun benar, mengapa menggunakan Fable untuk mereplikasi Astra, bukan langsung menggunakannya untuk memecahkan masalah terbuka baru?

Faktanya, Fable tidak hanya bisa ikut tren panas Astra, dia juga bisa memecahkan soal baru.

Pada Juli, Levent menggunakan Fable untuk memberikan contoh tandingan tiga dimensi dari Konjektur Jacobian, setelah itu bahkan ada orang yang secara khusus menulis materi verifikasi aljabar 7 halaman, mengkonfirmasi bahwa pemetaan eksplisit tersebut memang membantah konjektur untuk dimensi tiga dan lebih tinggi.

Pencapaian yang Tidak Dipahami Mayoritas Orang, Siapa yang Akan Memeriksa

10 pencapaian ini, seberapa pentingnya, sangat sulit dinilai oleh mayoritas orang.

Ethan Mollick menegaskan: bagi hampir setiap orang di bumi, ini bukan hanya di luar kemampuan, tetapi di luar jangkauan pemahaman. Kita hanya bisa percaya pada matematikawan profesional yang memberi tahu kita apakah ini hebat atau tidak.

Kode, gambar, obrolan, orang biasa masih bisa merasakan langsung kehebatan AI.

Tetapi keberadaan grup non-Sofic, contoh tandingan Konjektur Kekakuan Connes, teorema pengulangan paralel kuantum, ini hanya dapat dipahami oleh segelintir pakar.

Semakin jauh kemampuan AI melaju ke garis depan sains, yang dapat diandalkan publik semakin bukan pengalaman langsung, melainkan rantai kepercayaan yang panjang. Keadaan "bahkan tidak tahu harus terkejut bagaimana" ini, semakin banyak terjadi di berbagai bidang sekaligus.

Matematikawan Thomas Bloom mengingatkan, pencapaian ini menggunakan teori matematika yang terakumulasi ratusan tahun, sistem formalisasi yang dibangun langsung oleh matematikawan, menggambarkannya secara sederhana sebagai "AI menggantikan matematikawan", tidak jujur.

Standar yang dia berikan adalah: apakah pembuktian ini, mengajarkan kita hal baru tentang masalah ini?

Jadi masalah sebenarnya muncul: ketika AI dapat menghasilkan pembuktian matematika terdepan dengan biaya rendah, secara massal, apa yang seharusnya kita gunakan untuk mengukur pencapaiannya?

Jawabannya mungkin tidak ada di sisi produksinya, tetapi di sisi pemeriksaan: apakah suatu pembuktian dapat dipahami, diperiksa, dinilai bobotnya, baru dapat menentukan nilai sebenarnya.

Kemampuan paling langka, sedang beralih dari "membuat pembuktian" ke "memahami dan memeriksa pembuktian".

Ketika AI dalam semalam dapat membuktikan sepuluh masalah sulit, ujian sesungguhnya baru dimulai: pembuktian semakin cepat dibuat, apakah verifikasi kita, masih bisa mengejar?

Referensi:

https://x.com/haider1/status/2083908869915611554

https://x.com/polynoamial/status/2083470822258467194

https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742

Artikel ini berasal dari akun WeChat publik "新智元", penulis: ASI启示录

Pertanyaan Terkait

QApa yang diumumkan oleh peneliti OpenAI, Sébastien Bubeck, mengenai model Astra?

ASébastien Bubeck mengumumkan bahwa model Astra yang belum dirilis secara publik dari OpenAI telah membuktikan 10 hasil matematika terdepan dan menyediakan 10 sertifikat Lean serta analisis langkah demi langkah untuk setiap masalah.

QBagaimana tanggapan Anthropic terhadap pengumuman OpenAI tentang 10 terobosan matematika?

ADalam waktu kurang dari 24 jam, peneliti Anthropic, Levent Alpöge, menanggapi dengan menyatakan bahwa ia telah menyelesaikan 5 dari 10 masalah tersebut menggunakan model Fable yang tersedia untuk publik, yaitu masalah nomor 4, 5, 6, 7, dan 8.

QApa implikasi dari kemampuan Fable untuk mereplikasi setengah dari hasil Astra dalam waktu singkat?

AHal ini menunjukkan bahwa 'masa berlaku' atau keunggulan sebagai yang pertama (first-mover advantage) dalam penemuan matematika kini menjadi sangat singkat, hanya sekitar 24 jam, karena model AI yang sudah tersedia untuk umum dapat dengan cepat menyamai prestasi model yang belum dirilis.

QBerapa biaya yang diklaim OpenAI untuk menemukan solusi dari 10 masalah matematika tersebut?

AOpenAI mengklaim bahwa biaya untuk menemukan solusi dari 10 masalah tersebut kurang dari $2.000. Namun, ini hanya biaya marginal untuk inferensi token saat solusi berhasil ditemukan, tidak termasuk biaya pelatihan model, upaya manusia, dan verifikasi formal.

QMenurut artikel, tantangan utama apa yang muncul ketika AI mulai menghasilkan banyak bukti matematika tingkat lanjut?

ATantangan utamanya bergeser dari kemampuan 'membuat bukti' menjadi kemampuan 'memahami dan memverifikasi bukti'. Ketika AI dapat memproduksi bukti secara massal dan murah, kemampuan paling langka adalah memeriksa, memahami, dan menilai nilai sebenarnya dari bukti-bukti tersebut, karena hanya sedikit ahli yang dapat memahaminya.

Bacaan Terkait

Dia Adalah Pahlawan Dua Industri Besar Shanghai, Namun Meninggal dalam Keheningan dengan Penuh Penyesalan

Jiang Shangzhou, seorang mantan Wakil Direktur Komisi Ekonomi Shanghai, memainkan peran kunci dalam mengembangkan dua industri strategis di Tiongkok: sirkuit terintegrasi (chip) dan pesawat terbang komersial besar. Pada akhir 1990-an, ia dengan berani mengusulkan rencana ambisius untuk membangun 10 lini produksi chip 8 inci di Shanghai dalam lima tahun, melawan pandangan mainstream saat itu. Melalui upayanya, ia berhasil menarik talenta seperti Zhang Rujing dan mendirikan SMIC, serta mengundang Yin Zhiyao untuk mendirikan AMEC. Dalam waktu singkat, Shanghai melampaui target dengan 18 lini produksi. Ditengah perjuangan melawan kanker paru-paru, Jiang juga menjadi pendorong utama proyek pesawat terbang besar nasional. Sebagai ketua panel peninjauan proyek khusus negara, ia gigih memperjuangkan dimasukkannya "pesawat terbang sipil besar" ke dalam rencana pengembangan sains dan teknologi jangka panjang, yang akhirnya mengarah pada peluncuran proyek C919. Sepanjang karirnya, mulai dari Sanya, Hainan hingga Shanghai, Jiang sering dianggap terlalu visioner dan menghadapi berbagai tantangan. Ia meninggal pada tahun 2011 karena penyakitnya, tanpa sempat menyaksikan kesuksesan penuh dari dua industri yang ia rintis. Namun, fondasi yang ia bangun menjadikan Shanghai sebagai pemimpin nasional dalam industri chip dan pesawat terbang, mewariskan dampak mendalam bagi pembangunan industri Tiongkok.

marsbit3m yang lalu

Dia Adalah Pahlawan Dua Industri Besar Shanghai, Namun Meninggal dalam Keheningan dengan Penuh Penyesalan

marsbit3m yang lalu

Bagaimana Fokus Pendapatan AMD Bergeser ke Data Center dalam 12 Kuartal

Laporan kuartal kedua AMD menunjukkan pergeseran signifikan dalam struktur pendapatannya. Dalam 12 kuartal terakhir, kontribusi bisnis *data center* terhadap total pendapatan perusahaan meningkat dari 27,6% menjadi 58,2%, menjadikannya segmen pendapatan terbesar sejak kuartal keempat 2025. Pada kuartal terakhir, pendapatan *data center* mencapai $6,718 miliar, meningkat 107% secara tahunan (YoY). Sementara itu, pendapatan segmen *gaming* turun 31% YoY menjadi $779 juta. Namun, penurunan ini tidak cukup besar untuk menjelaskan pertumbuhan pesat *data center*, mengindikasikan bahwa pertumbuhan perusahaan lebih didorong oleh perluasan basis pendapatan total, bukan hanya alih sumber daya internal dari satu segmen ke segmen lainnya. Pertumbuhan absolut total pendapatan AMD mendukung kesimpulan ini. Dibandingkan dengan pesaing, tren pertumbuhan pendapatan *data center* AMD memang kuat, namun skalanya masih jauh di bawah Nvidia ($75,2 miliar pada kuartal terakhir yang diungkapkan). Posisinya relatif lebih dekat dengan Intel, meski definisi segmen antar perusahaan berbeda dan periode pelaporan tidak selalu sepenuhnya sejalan. Secara keseluruhan, data menunjukkan bahwa *data center* kini telah menjadi pusat pendapatan AMD. Meski terjadi kontraksi di bisnis *gaming* pada periode yang sama, data laporan keuangan publik tidak cukup untuk membuktikan adanya pengalihan sumber daya secara langsung dan sederhana antara kedua divisi tersebut.

marsbit4m yang lalu

Bagaimana Fokus Pendapatan AMD Bergeser ke Data Center dalam 12 Kuartal

marsbit4m yang lalu

Diagram Wallet Cloudflare: Pemain Baru dalam Pembayaran Stablecoin dengan X402

Cloudflare meluncurkan Wallets, yang memungkinkan pengguna mengklaim "handle" untuk identitas dompet masa depan, namun fungsi inti seperti pengisian saldo, pembayaran, dan Virtual Wallet untuk agen AI belum tersedia. Produk ini merupakan bagian dari ekosistem pembayaran Cloudflare yang mencakup Stripe Projects (untuk perwakilan pembayaran kartu) dan Monetization Gateway (untuk penerimaan pembayaran via x402). Wallets dimaksudkan untuk melengkapi sisi pembayar dengan identitas dan aturan otorisasi. Protokol pembayaran x402 telah mencatat volume transaksi kecil yang signifikan (rata-rata $0,32 per transaksi), menunjukkan potensi untuk pembayaran API atau konten mikro. Namun, data ini tidak secara spesifik mencerminkan adopsi Cloudflare Wallets. Contoh implementasi menunjukkan alur pembayaran mikro sebesar $0,01, di mana agen menandatangani pembayaran setelah menerima kode status HTTP 402. Dalam pengembangan saat ini, kunci privat masih dipegang pengembang, dan Wallets bertujuan untuk memperkenalkan kontrol seperti Virtual Wallet terpisah, batas pengeluaran, dan daftar putih untuk keamanan yang lebih baik. Tiga jalur pembayaran oleh agen (Stripe Projects, x402 untuk pengembang, dan rencana Cloudflare Wallets) memiliki model keamanan dan ketersediaan yang berbeda. Wallets masih memerlukan pengembangan lebih lanjut mengenai mata uang kripto yang didukung, KYC, dan detail operasional lainnya.

marsbit25m yang lalu

Diagram Wallet Cloudflare: Pemain Baru dalam Pembayaran Stablecoin dengan X402

marsbit25m yang lalu

TradeXYZ dan Hyperliquid: Mengungkap Hubungan Simbiosis di Bawah Pembagian 50%

Pasar semakin berhati-hati. Di sisi tradisional, pengeluaran AI hanya dihargai jika mendorong pertumbuhan tanpa mengikis arus kas. Di sisi crypto, tekanan berlanjut dari aliran keluar dana ETF dan kenaikan imbal hasil. Dalam crypto, kepemimpinan bergeser kembali ke Solana dan DEX. Solana naik 8,5%, didorong oleh token seperti META, sementara sektor DEX naik 5,2% dengan Uniswap memimpin. Perdebatan utama berpusat pada TradeXYZ dan Hyperliquid. TradeXYZ, yang membangun di atas Hyperliquid, kini mendominasi lebih dari 50% volume perdagangan RWA di platform tersebut. Mereka diwajibkan membagikan 50% pendapatan HIP-3 mereka ke Hyperliquid. Muncul kekhawatiran apakah TradeXYZ akan meninggalkan Hyperliquid karena bagi hasil 50% ini, atau sebaliknya, Hyperliquid akan mengambil alih pasar RWA. Analisis menyimpulkan hubungan ini adalah simbiosis mutualistik. TradeXYZ bergantung pada infrastruktur dan basis pengguna Hyperliquid, sementara Hyperliquid diuntungkan oleh kesuksesan TradeXYZ. Meninggalkan satu sama lain akan merusak reputasi dan ekonomi kedua belah pihak. Hyperliquid juga mendapat nilai melalui cara lain di luar bagi hasil 50%, seperti biaya prioritas dan peningkatan pasokan USDC di chain, yang menghasilkan pendapatan tambahan. Pertanyaan menarik bukanlah tentang pembagian 50/50, tetapi bagaimana kedua pihak beralih dari mode pertumbuhan ke basis biaya yang lebih stabil dan tinggi.

marsbit40m yang lalu

TradeXYZ dan Hyperliquid: Mengungkap Hubungan Simbiosis di Bawah Pembagian 50%

marsbit40m yang lalu

Laporan: DeepSeek Mulai Kembali Pendanaan, Valuasi Sebelum Investasi 500 Miliar Yuan

Sejumlah sumber transaksi mengungkapkan kepada _Caijing_ bahwa perusahaan model besar DeepSeek telah membuka kembali putaran kedua pendanaannya. Putaran ini rencananya mengumpulkan dana 50 miliar yuan dengan valuasi pra-investasi sekitar 500 miliar yuan, dan ditargetkan menyelesaikan penandatanganan pada akhir Agustus. DeepSeek menyelesaikan putaran pertama pendanaan sebesar 50 miliar yuan pada Juni dengan valuasi melebihi 350 miliar yuan. Putaran kedua, yang sempat dijeda pada akhir Juli karena ketidakpuasan pendiri terhadap informasi yang beredar, kini telah diaktifkan kembali. Valuasi pra-investasi putaran kedua naik sekitar 43% dari putaran pertama. Jika berhasil, total pendanaan dari kedua putaran akan melebihi 1 triliun yuan. Investor putaran pertama termasuk Dana Industri Kecerdasan Buatan Nasional, Tencent, CATL, dan modal ventura lainnya. Meski dijalankan dengan lebih tertutup setelah diaktifkan kembali, minat investor tetap tinggi, dengan banyak lembaga yang sebelumnya tertarik masih mengantri. Di tengah persaingan ketat dengan perusahaan seperti Moonshot AI, yang juga sedang dalam proses pendanaan dan menuju IPO, kemampuan model dan efisiensi biaya menjadi penentu kunci valuasi. DeepSeek baru-baru ini merilis DeepSeek-V4-Flash versi final, yang menunjukkan peningkatan kemampuan agen dan menawarkan harga yang kompetitif. Model ini menduduki peringkat teratas dalam konsumsi token di platform OpenRouter, menunjukkan daya tariknya di pasar global.

marsbit1j yang lalu

Laporan: DeepSeek Mulai Kembali Pendanaan, Valuasi Sebelum Investasi 500 Miliar Yuan

marsbit1j yang lalu

Trading

Spot
活动图片