Dua model baru Claude yang baru saja terungkap kemarin—Marshmallow dan Melon, hari ini uji coba praktisnya sudah muncul!
Setelah diuji coba, ada yang menemukan bahwa kedua model baru ini memiliki performa yang sangat menakutkan dalam pembelajaran penguatan 3D dan tata letak ruang bangunan.

Selain itu, konsumsi daya komputasi mereka juga sangat gila.
Sebelum memberikan jawaban, mereka akan mengonsumsi sejumlah besar "token pemikiran" (Thinking Tokens) untuk melakukan penalaran logika yang mendalam, bahkan berkali-kali mendekati batas penggunaan sistem!
Dari model ini terlihat, Claude sedang berevolusi menjadi raksasa AI generasi berikutnya yang memiliki kemampuan "pemikiran lambat" dan penalaran fisika spasial yang mendalam.

One-Shot Kuasai Pembelajaran Penguatan 3D dan Tata Letak Bangunan
Ada yang memberikan penilaian setelah uji coba: Anthropic benar-benar gila memajukan pembelajaran penguatan 3D.
Tata letak ruang bangunan sungguh luar biasa bagusnya, dan semua ini dihasilkan langsung dalam satu langkah (One-Shot)!


Harus diketahui, bagi LLM, imajinasi spasial selalu menjadi titik kelemahan yang mematikan.
Membuat AI memahami hubungan koordinat fisik dan hukum gravitasi meja kursi dalam ruangan 3D, atau merencanakan tata letak kompleks bangunan dengan alur pergerakan dan struktur penahan beban yang rumit, hampir mustahil.
Tapi kali ini, "Marshmallow" dan "Melon" Claude sepertinya telah melompati jurang ini.
Mereka mampu langsung memahami dan menghasilkan koordinat 3D yang kompleks dan hubungan spasial.
Selain itu, dalam uji coba ditemukan bahwa tata letak bangunan mereka sangat luar biasa, menunjukkan bahwa model baru ini juga memiliki performa yang kuat dalam menangani kendala topologi, geometri, dan fisika.
Dan, mereka menghasilkan output One-Shot, tidak memerlukan manusia untuk berulang kali menyesuaikan prompt untuk memperbaiki kesalahan, model dapat langsung menghasilkan data adegan 3D yang sempurna setelah pemikiran internal yang mendalam.
Di balik ini tersembunyi nilai komersial dan industri yang sangat besar.
Bayangkan, pengembang game masa depan hanya perlu mendeskripsikan dengan bahasa alami: "Bantu saya menghasilkan benteng bergaya abad pertengahan, dengan tiga menara pertahanan dan satu lorong bawah tanah tersembunyi", Claude dapat langsung menghasilkan kode model 3D atau parameter tata letak yang sempurna.
Arsitek dapat langsung meminta AI menghasilkan puluhan skema tata letak awal yang sesuai dengan struktur mekanik berdasarkan kondisi medan dan pencahayaan. Konstruksi metaverse, kembaran digital industri, lingkungan simulasi kendaraan otonom...
Semua ini akan benar-benar dibentuk ulang karena kemampuan generasi 3D yang kuat ini!
Serangan Ganda Marshmallow dan Melon
Kemarin, seluruh internet dihebohkan oleh marshmallow dan melon.
Dua model yang terungkap kali ini memiliki kode internal masing-masing claude-marshmallow-eap (Marshmallow) dan claude-melon-eap (Melon).

Aturan penamaan "makanan + EAP" ini melanjutkan tradisi claude-horchata-eap (Horchata, minuman Meksiko) yang pernah mereka uji singkat pada Juli tahun ini.
Dari mana sebenarnya kedua model ini muncul?
Menurut data yang diintersep dari catatan lalu lintas API oleh pengembang, pada periode 00:45-00:57Z tanggal 21 Agustus, ID claude-marshmallow-ht-eap dipanggil dengan frekuensi tinggi sebanyak 57 kali dalam lalu lintas API!
Kemudian, muncul dengan mencolok dalam daftar model Claude Code sebagai "Custom model", dengan jendela konteks super panjang mencapai 1 juta Token yang menakjubkan.
Meskipun saat ini kedua model ini belum memiliki endpoint API resmi, sepertinya terbatas untuk penguji tim merah atau personel inti internal, tetapi umpan balik uji coba awal yang tersebar sudah cukup menggemparkan.



Kemampuan komprehensif "Marshmallow" dianggap sedikit lebih kuat daripada "Melon".
Dalam percakapan sehari-hari dan interaksi logika, pengalaman "Marshmallow" bahkan lebih baik daripada Opus 5 saat ini, percakapan terasa lebih alami dan menyenangkan.
Meskipun kinerja mereka saat ini sepertinya masih di bawah level "Fable" teratas Anthropic, apakah mereka Opus 5.1 yang legendaris? Sonnet 5.1? Atau iterasi Haiku yang benar-benar baru?
Saat ini belum ada kesimpulan.

Pemakan Daya Komputasi: "Token Pemikiran" yang Gila
Belum lagi, beberapa penguji menemukan fenomena yang sangat tidak biasa: Saat menggunakan dua model baru ini, konsumsi daya komputasi mencapai tingkat yang sangat gila!
Seorang penguji berteriak dalam tweet: "Saya perhatikan satu kesamaan dari kedua model ini, mereka menggunakan sejumlah besar token pemikiran, sehingga saat saya menguji, berkali-kali langsung memicu batas atas (jumlah token maksimum)!"
Apa itu "token pemikiran"? Mengapa begitu penting?
Dalam interaksi model besar sebelumnya, AI sering seperti penjawab "cepat bicara", menghasilkan jawaban kata demi kata secara instan berdasarkan distribusi probabilitas.
Sedangkan model generasi baru Claude benar-benar mengubah logika ini. Sebelum akhirnya memberikan jawaban, model akan menghasilkan sejumlah besar token "tak terlihat" di latar belakang, untuk melakukan deduksi diri yang sangat mendalam, membangun rantai pemikiran, dan mencoba-coba logika.

Penumpahan daya komputasi "tanpa memperhitungkan biaya" ini melepaskan sinyal yang sangat kuat: Anthropic diam-diam sedang mengatasi hambatan penalaran mendalam AI!
Ini juga membuktikan spekulasi sebelumnya dalam industri—persaingan model besar sedang beralih dari "penumpukan daya komputasi pada fase pelatihan" ke "konsumsi daya komputasi pada fase penalaran".
Saat Claude mulai "berpikir" dengan gila hingga menyentuh batas atas, kualitas jawaban yang dihasilkannya akan membentuk serangan dimensi yang lebih rendah terhadap model tradisional.
Diduga Pemadaman Darurat? "Pertempuran Balas Dendam" Opus 5
Kebocoran tiba-tiba kedua model misterius ini, waktunya juga halus.
Hanya kurang dari sebulan sebelumnya, pada 24 Juli 2026, Anthropic baru saja merilis model andalan yang dinanti-nantikan, Opus 5.
Sebelumnya, Sonnet 5 yang dirilis pada 30 Juni pernah mendapat pujian luas.
Namun, Opus 5 malah mengalami kegagalan telak.
Ada pengembang yang mengejek tanpa ampun di X: "Umpan balik negatif Opus 5 terlalu parah, hingga Anthropic terpaksa segera meluncurkan dua model baru untuk mencoba menggantikannya... mati ketawa."
Memang, Opus 5 sepertinya tidak memenuhi harapan pengguna akan "peningkatan lintas generasi". Bagi Anthropic yang terburu-buru meluncur, ini jelas merupakan pukulan berat.
Oleh karena itu, paparan "Marshmallow" dan "Melon" pada titik genting ini memicu imajinasi tak terbatas dari luar.
Spekulasi Satu: Serangan balik terakhir Opus 5.1.
Banyak yang percaya, dua model yang terkait erat dengan Opus 5.1 ini adalah "versi perkuat" setelah Anthropic melakukan pembuatan ulang darurat terhadap kekurangan Opus 5.
Dengan memperkenalkan mekanisme "token pemikiran" yang kuat, langit-langit logika model ditingkatkan secara paksa.
Spekulasi Dua: Serangan mendadak Sonnet / Haiku generasi baru.
Beberapa penguji juga berpendapat, mengingat kecepatan dan rasio harga-kinerja mereka yang menakjubkan, mereka mungkin adalah versi pembaruan Sonnet atau Haiku, lagipula mereka tidak diberi gelar "Fable" tingkat atas.

Tapi apapun situasinya, Anthropic jelas sudah tidak bisa diam lagi.
Mereka sedang gila-gilaan mempercepat kecepatan iterasi, bahkan tidak segan-segan langsung menguji model terdepan yang sangat mengonsumsi daya komputasi. X
Para pengembang sudah tidak sabar: "Beberapa minggu hingga bulan ke depan akan menjadi sangat menarik!"
Bisakah Marshmallow dan Melon menghapus rasa malu sebelumnya Opus 5, dan membuat Anthropic menang lagi?
Referensi:
https://x.com/Lentils80/status/2091704307863142812?s=20
https://x.com/NFT_Chen/status/2091764673767198730?s=20
Artikel ini berasal dari akun WeChat publik "New Zhiyuan", penulis: ASI Apocalypse; editor: Aeneas





