Hasil Uji Coba Dua Model Baru Claude Bocor, Kemampuan Penalaran Spasial Luar Biasa, Tenaga Komputasi Langsung Tersedot Habis

marsbitDipublikasikan tanggal 2026-08-25Terakhir diperbarui pada 2026-08-25

Abstrak

Kemarin, dua model baru Claude yang disebut "Marshmallow" dan "Melon" diuji coba, menunjukkan kemampuan yang luar biasa dalam penalaran spasial 3D dan tata letak arsitektur. Model-model ini dapat menghasilkan data pemandangan 3D yang kompleks dalam satu langkah (one-shot), mengatasi kelemahan LLM tradisional dalam imajinasi spasial. Kemampuan ini memiliki potensi besar untuk industri seperti pengembangan game, arsitektur, dan simulasi. Namun, model baru ini dikenal sebagai "pemakan daya komputasi" karena menggunakan jumlah "token pemikiran" (thinking tokens) yang sangat besar untuk melakukan penalaran logis mendalam sebelum memberikan jawaban, bahkan sering mendekati batas maksimum penggunaan sistem. Kedua model ini, yang ditemukan dalam catatan lalu lintas API, dianggap sebagai respons Anthropic terhadap kritik terhadap model andalannya, Opus 5, yang dirilis Juli lalu. Beberapa berspekulasi ini adalah versi perbaikan (Opus 5.1) atau iterasi baru dari Sonnet/Haiku. Uji coba awal menunjukkan bahwa "Marshmallow" sedikit lebih kuat dan memiliki percakapan yang lebih alami daripada Opus. Kebocoran ini menandai perlombaan Anthropic dalam meningkatkan kecepatan iterasi dan kemampuan penalaran mendalam AI, meskipun dengan konsumsi daya komputasi yang sangat tinggi.

Dua model baru Claude yang baru saja terungkap kemarin—Marshmallow dan Melon, hari ini uji coba praktisnya sudah muncul!

Setelah diuji coba, ada yang menemukan bahwa kedua model baru ini memiliki performa yang sangat menakutkan dalam pembelajaran penguatan 3D dan tata letak ruang bangunan.

Selain itu, konsumsi daya komputasi mereka juga sangat gila.

Sebelum memberikan jawaban, mereka akan mengonsumsi sejumlah besar "token pemikiran" (Thinking Tokens) untuk melakukan penalaran logika yang mendalam, bahkan berkali-kali mendekati batas penggunaan sistem!

Dari model ini terlihat, Claude sedang berevolusi menjadi raksasa AI generasi berikutnya yang memiliki kemampuan "pemikiran lambat" dan penalaran fisika spasial yang mendalam.

One-Shot Kuasai Pembelajaran Penguatan 3D dan Tata Letak Bangunan

Ada yang memberikan penilaian setelah uji coba: Anthropic benar-benar gila memajukan pembelajaran penguatan 3D.

Tata letak ruang bangunan sungguh luar biasa bagusnya, dan semua ini dihasilkan langsung dalam satu langkah (One-Shot)!

Harus diketahui, bagi LLM, imajinasi spasial selalu menjadi titik kelemahan yang mematikan.

Membuat AI memahami hubungan koordinat fisik dan hukum gravitasi meja kursi dalam ruangan 3D, atau merencanakan tata letak kompleks bangunan dengan alur pergerakan dan struktur penahan beban yang rumit, hampir mustahil.

Tapi kali ini, "Marshmallow" dan "Melon" Claude sepertinya telah melompati jurang ini.

Mereka mampu langsung memahami dan menghasilkan koordinat 3D yang kompleks dan hubungan spasial.

Selain itu, dalam uji coba ditemukan bahwa tata letak bangunan mereka sangat luar biasa, menunjukkan bahwa model baru ini juga memiliki performa yang kuat dalam menangani kendala topologi, geometri, dan fisika.

Dan, mereka menghasilkan output One-Shot, tidak memerlukan manusia untuk berulang kali menyesuaikan prompt untuk memperbaiki kesalahan, model dapat langsung menghasilkan data adegan 3D yang sempurna setelah pemikiran internal yang mendalam.

Di balik ini tersembunyi nilai komersial dan industri yang sangat besar.

Bayangkan, pengembang game masa depan hanya perlu mendeskripsikan dengan bahasa alami: "Bantu saya menghasilkan benteng bergaya abad pertengahan, dengan tiga menara pertahanan dan satu lorong bawah tanah tersembunyi", Claude dapat langsung menghasilkan kode model 3D atau parameter tata letak yang sempurna.

Arsitek dapat langsung meminta AI menghasilkan puluhan skema tata letak awal yang sesuai dengan struktur mekanik berdasarkan kondisi medan dan pencahayaan. Konstruksi metaverse, kembaran digital industri, lingkungan simulasi kendaraan otonom...

Semua ini akan benar-benar dibentuk ulang karena kemampuan generasi 3D yang kuat ini!

Serangan Ganda Marshmallow dan Melon

Kemarin, seluruh internet dihebohkan oleh marshmallow dan melon.

Dua model yang terungkap kali ini memiliki kode internal masing-masing claude-marshmallow-eap (Marshmallow) dan claude-melon-eap (Melon).

Aturan penamaan "makanan + EAP" ini melanjutkan tradisi claude-horchata-eap (Horchata, minuman Meksiko) yang pernah mereka uji singkat pada Juli tahun ini.

Dari mana sebenarnya kedua model ini muncul?

Menurut data yang diintersep dari catatan lalu lintas API oleh pengembang, pada periode 00:45-00:57Z tanggal 21 Agustus, ID claude-marshmallow-ht-eap dipanggil dengan frekuensi tinggi sebanyak 57 kali dalam lalu lintas API!

Kemudian, muncul dengan mencolok dalam daftar model Claude Code sebagai "Custom model", dengan jendela konteks super panjang mencapai 1 juta Token yang menakjubkan.

Meskipun saat ini kedua model ini belum memiliki endpoint API resmi, sepertinya terbatas untuk penguji tim merah atau personel inti internal, tetapi umpan balik uji coba awal yang tersebar sudah cukup menggemparkan.

Kemampuan komprehensif "Marshmallow" dianggap sedikit lebih kuat daripada "Melon".

Dalam percakapan sehari-hari dan interaksi logika, pengalaman "Marshmallow" bahkan lebih baik daripada Opus 5 saat ini, percakapan terasa lebih alami dan menyenangkan.

Meskipun kinerja mereka saat ini sepertinya masih di bawah level "Fable" teratas Anthropic, apakah mereka Opus 5.1 yang legendaris? Sonnet 5.1? Atau iterasi Haiku yang benar-benar baru?

Saat ini belum ada kesimpulan.

Pemakan Daya Komputasi: "Token Pemikiran" yang Gila

Belum lagi, beberapa penguji menemukan fenomena yang sangat tidak biasa: Saat menggunakan dua model baru ini, konsumsi daya komputasi mencapai tingkat yang sangat gila!

Seorang penguji berteriak dalam tweet: "Saya perhatikan satu kesamaan dari kedua model ini, mereka menggunakan sejumlah besar token pemikiran, sehingga saat saya menguji, berkali-kali langsung memicu batas atas (jumlah token maksimum)!"

Apa itu "token pemikiran"? Mengapa begitu penting?

Dalam interaksi model besar sebelumnya, AI sering seperti penjawab "cepat bicara", menghasilkan jawaban kata demi kata secara instan berdasarkan distribusi probabilitas.

Sedangkan model generasi baru Claude benar-benar mengubah logika ini. Sebelum akhirnya memberikan jawaban, model akan menghasilkan sejumlah besar token "tak terlihat" di latar belakang, untuk melakukan deduksi diri yang sangat mendalam, membangun rantai pemikiran, dan mencoba-coba logika.

Penumpahan daya komputasi "tanpa memperhitungkan biaya" ini melepaskan sinyal yang sangat kuat: Anthropic diam-diam sedang mengatasi hambatan penalaran mendalam AI!

Ini juga membuktikan spekulasi sebelumnya dalam industri—persaingan model besar sedang beralih dari "penumpukan daya komputasi pada fase pelatihan" ke "konsumsi daya komputasi pada fase penalaran".

Saat Claude mulai "berpikir" dengan gila hingga menyentuh batas atas, kualitas jawaban yang dihasilkannya akan membentuk serangan dimensi yang lebih rendah terhadap model tradisional.

Diduga Pemadaman Darurat? "Pertempuran Balas Dendam" Opus 5

Kebocoran tiba-tiba kedua model misterius ini, waktunya juga halus.

Hanya kurang dari sebulan sebelumnya, pada 24 Juli 2026, Anthropic baru saja merilis model andalan yang dinanti-nantikan, Opus 5.

Sebelumnya, Sonnet 5 yang dirilis pada 30 Juni pernah mendapat pujian luas.

Namun, Opus 5 malah mengalami kegagalan telak.

Ada pengembang yang mengejek tanpa ampun di X: "Umpan balik negatif Opus 5 terlalu parah, hingga Anthropic terpaksa segera meluncurkan dua model baru untuk mencoba menggantikannya... mati ketawa."

Memang, Opus 5 sepertinya tidak memenuhi harapan pengguna akan "peningkatan lintas generasi". Bagi Anthropic yang terburu-buru meluncur, ini jelas merupakan pukulan berat.

Oleh karena itu, paparan "Marshmallow" dan "Melon" pada titik genting ini memicu imajinasi tak terbatas dari luar.

Spekulasi Satu: Serangan balik terakhir Opus 5.1.

Banyak yang percaya, dua model yang terkait erat dengan Opus 5.1 ini adalah "versi perkuat" setelah Anthropic melakukan pembuatan ulang darurat terhadap kekurangan Opus 5.

Dengan memperkenalkan mekanisme "token pemikiran" yang kuat, langit-langit logika model ditingkatkan secara paksa.

Spekulasi Dua: Serangan mendadak Sonnet / Haiku generasi baru.

Beberapa penguji juga berpendapat, mengingat kecepatan dan rasio harga-kinerja mereka yang menakjubkan, mereka mungkin adalah versi pembaruan Sonnet atau Haiku, lagipula mereka tidak diberi gelar "Fable" tingkat atas.

Tapi apapun situasinya, Anthropic jelas sudah tidak bisa diam lagi.

Mereka sedang gila-gilaan mempercepat kecepatan iterasi, bahkan tidak segan-segan langsung menguji model terdepan yang sangat mengonsumsi daya komputasi. X

Para pengembang sudah tidak sabar: "Beberapa minggu hingga bulan ke depan akan menjadi sangat menarik!"

Bisakah Marshmallow dan Melon menghapus rasa malu sebelumnya Opus 5, dan membuat Anthropic menang lagi?

Referensi:

https://x.com/Lentils80/status/2091704307863142812?s=20

https://x.com/NFT_Chen/status/2091764673767198730?s=20

Artikel ini berasal dari akun WeChat publik "New Zhiyuan", penulis: ASI Apocalypse; editor: Aeneas

Pertanyaan Terkait

QApa saja kemampuan utama dari dua model baru Claude, yaitu "Marshmallow" dan "Melon", yang disebutkan dalam artikel?

ADua model baru Claude ini menunjukkan kemampuan luar biasa dalam penalaran spasial 3D dan perencanaan tata letak arsitektur. Mereka dapat memahami dan menghasilkan koordinat 3D serta hubungan spasial yang kompleks secara one-shot, tanpa memerlukan penyesuaian prompt berulang.

QApa itu "Thinking Tokens" dan mengapa konsumsinya oleh model baru ini disebut sangat tinggi?

A"Thinking Tokens" adalah token 'tak terlihat' yang digunakan model untuk melakukan deduksi diri, membangun rantai pemikiran, dan mencoba logika secara mendalam sebelum memberikan jawaban akhir. Konsumsinya sangat tinggi karena model baru ini melakukan proses penalaran yang sangat intensif, bahkan sering mendekati batas maksimum token sistem.

QMenurut artikel, apa signifikansi kemunculan model "Marshmallow" dan "Melon" terkait peluncuran Opus 5?

AKemunculan model "Marshmallow" dan "Melon" diduga sebagai respons atau perbaikan darurat dari Anthropic terhadap Opus 5, yang menerima banyak ulasan negatif karena tidak memenuhi ekspektasi peningkatan generasional. Model baru ini mungkin adalah versi perbaikan yang ditingkatkan untuk menutupi kekurangan Opus 5.

QApa potensi nilai komersial dan industri dari kemampuan penalaran spasial 3D model Claude yang baru ini?

AKemampuan ini memiliki potensi besar untuk merevolusi industri seperti pengembangan game (membuat model 3D dari deskripsi teks), arsitektur (menghasilkan opsi tata letak), serta pembangunan lingkungan simulasi untuk metaverse, digital twin industri, dan kendaraan otonom.

QBagaimana cara kedua model baru Claude ini diakses menurut artikel, dan apa konteks penemuannya?

AKedua model ini tampaknya masih terbatas untuk penguji internal atau tim red team, belum tersedia melalui endpoint API publik. Mereka ditemukan dalam lalu lintas API dan muncul dalam daftar model Claude Code sebagai "Custom model" dengan konteks jendela hingga 1 juta token.

Bacaan Terkait

Uji Permintaan: Paus Bitcoin Raih Keuntungan Rekor $1,2 Miliar, Pemilik Ethereum Kembali ke Zona Profit

Tes permintaan: Paus Bitcoin (whale) mengunci keuntungan rekor sebesar $1,2 miliar hanya dalam tiga hari setelah pemulihan harga aset kripto terdepan. Menurut CryptoQuant, ini merupakan peristiwa pengambilan keuntungan terbesar yang pernah tercatat untuk kohort ini. Puncaknya terjadi pada 20 Agustus, sekitar $614 juta, juga menjadi rekor harian absolut. Aksi pengambilan keuntungan ini dimulai setelah harga Bitcoin kembali melampaui harga realisasi paus jangka pendek, yang sekitar $68.900. Pada 23 Agustus, Bitcoin diperdagangkan mendekati $77.700, atau sekitar 12,8% di atas biaya rata-rata mereka. Situasi ini dianggap sebagai tes penting bagi permintaan Bitcoin. Jika aset dapat bertahan di atas level biaya paus dan volume pengambilan keuntungan kembali normal, ini dapat menunjukkan kemampuan permintaan baru menyerap tekanan jual. Sementara itu, pemegang besar Ethereum (ETH) juga kembali ke zona keuntungan yang belum direalisasi menyusul reli harga. Namun, tingkat profitabilitas saat ini masih relatif rendah. Koefisien profit/rugi yang belum direalisasi untuk berbagai kohort adalah: 0,075 (untuk pemegang 1.000-10.000 ETH), 0,16 (10.000-100.000 ETH), dan 0,38 (lebih dari 100.000 ETH). Peningkatan ini dilihat sebagai sinyal positif yang dapat meningkatkan sentimen investor besar, mengingat pada Juni lalu mereka berada dalam kerugian signifikan, sementara ETH telah naik lebih dari 65% sejak saat itu.

cryptonews.ru2m yang lalu

Uji Permintaan: Paus Bitcoin Raih Keuntungan Rekor $1,2 Miliar, Pemilik Ethereum Kembali ke Zona Profit

cryptonews.ru2m yang lalu

Tim Kinetiq Mengumumkan Jaringan L2 Elysium untuk Hyperliquid

Protokol staking likuid Kinetiq mengumumkan Elysium, jaringan Layer-2 baru untuk ekosistem Hyperliquid pada 24 Agustus. Jaringan ini dirancang untuk meningkatkan kapasitas HyperEVM dan mempermudah peluncuran pasar spot, token, serta aplikasi DeFi. Elysium akan menggunakan token $HYPE untuk membayar biaya gas (gas fee) dan terhubung langsung dengan mesin perdagangan HyperCore, memberikan akses likuiditas dan data orderbook kepada aplikasi. Rincian teknis dan daftar mitra akan diumumkan kemudian, dengan peluncuran direncanakan "segera." Tujuan utama Elysium adalah mengatasi keterbatasan HyperEVM, seperti kapasitas rendah dan biaya tinggi, dengan menawarkan kecepatan verifikasi blok dan transaksi yang jauh lebih tinggi. Jaringan ini terutama ditujukan untuk aplikasi yang membutuhkan pembaruan status cepat, seperti perdagangan spot frekuensi tinggi, AMM, dan layanan DeFi lainnya. Elysium juga akan menyediakan data orderbook yang lebih mendalam bagi pengembang. Selain itu, Elysium menyederhanakan proses penerbitan aset di ekosistem Hyperliquid, memungkinkan token melewati tahap likuiditas AMM, pasar spot di HyperCore, dan akhirnya pasar futures perpetual (perp) melalui mekanisme HIP-3 dalam satu alur terpadu. Model pendapatan jaringan mengalokasikan 50% dari fee sequencer untuk pembakaran token $KNTQ, 25% untuk pengembang aplikasi, dan 25% untuk kas Kinetiq. Peluncuran ini menandai perluasan bisnis Kinetiq di luar staking likuid $HYPE, yang produk utamanya tetap adalah token kHYPE.

cryptonews.ru4m yang lalu

Tim Kinetiq Mengumumkan Jaringan L2 Elysium untuk Hyperliquid

cryptonews.ru4m yang lalu

Hyperliquid Policy Center Serukan Regulator AS untuk Membuat Kerangka Kerja untuk Futures Tanpa Waktu Kadaluarsa

Organisasi nirlaba Hyperliquid Policy Center menyerukan kepada SEC dan CFTC di AS untuk membuat kerangka regulasi khusus untuk futures tanpa tanggal kadaluarsa (perpetual futures). Mereka mendorong perubahan klasifikasi kontrak semacam itu, terutama untuk derivatif atas sekuritas, agar dapat diperdagangkan lebih mudah. Inti proposal mereka adalah bahwa yurisdiksi kontrak harus ditentukan oleh aset dasarnya, bukan oleh perubahan sifat ekonominya. Mereka berargumen bahwa kontrak perpetual untuk saham harus diklasifikasikan sebagai futures biasa (diawasi bersama oleh CFTC dan SEC), bukan sebagai security-based swaps (SBS), karena memiliki karakteristik standar seperti kontrak yang dapat dipertukarkan, harga publik, dan penyelesaian dengan transaksi offset. Hyperliquid Policy Center merekomendasikan penerbitan pedoman bersama, pendekatan regulasi yang seragam untuk berbagai aset dasar (seperti bitcoin, minyak, emas, dan saham), serta modernisasi aturan untuk futures sekuritas. Usulan ini menghadapi penolakan dari bursa tradisional seperti CME Group dan ICE, yang menginginkan regulasi yang lebih ketat untuk platform seperti Hyperliquid. Bahkan, CME Group telah mengajukan gugatan terhadap CFTC terkait klasifikasi perpetual futures ini, dengan mendorong agar kontrak tersebut dikategorikan sebagai swap yang memiliki persyaratan margin dan modal lebih ketat.

cryptonews.ru6m yang lalu

Hyperliquid Policy Center Serukan Regulator AS untuk Membuat Kerangka Kerja untuk Futures Tanpa Waktu Kadaluarsa

cryptonews.ru6m yang lalu

Trading

Spot
活动图片