Hari ini, pertarungan ini sungguh magis!
Di satu sisi, Liang Wenfeng akhirnya merilis DeepSeek V4 Pro versi resmi di dini hari.
Di sisi lain, Musk meluncurkan Grok 4.6 generasi terbaru, dengan fokus pada biaya rendah dan performa kuat.
Dua raksasa ini, dirilis pada waktu yang bersamaan, aroma bubuk mesiu langsung memenuhi udara.

Yang mereka incar, hampir adalah hal yang sama—
Membuat model mampu terus menggunakan alat, memodifikasi kode, memverifikasi hasil, dan akhirnya menyerahkan produk jadi yang benar-benar dapat digunakan dalam tugas-tugas panjang.
DeepSeek V4 Pro Datang
Musk Kirim Grok 4.6 Bertarung
DeepSeek V4 Pro versi resmi mencatatkan prestasi paling mencolok dengan meraih posisi pertama mutlak dalam dua evaluasi, langsung membalikkan Fable 5.
Dalam Uji Agen Kecerdasan Keamanan Siber CyberGym mencetak 83.3 poin, mengungguli 83.1 poin Fable 5, 78.3 poin Opus 4.8.
Dalam Tugas Otomasi AutomationBench mencetak 31.8 poin, menekan 29.1 poin Fable 5 dan 27.2 poin Opus 4.8.
Yang paling "tepat muka" terjadi di Terminal-Bench 2.1.
DeepSeek mendapatkan 87.9 poin, mengungguli 85.0 poin Opus 4.8, dan hanya terpaut 0.1 poin dari 88.0 poin Fable 5.
Dalam beberapa uji Agen berkesulitan tinggi lainnya, DeepSeek berhasil melampaui Opus 4.8 secara mutlak.
Dalam "Ujian Terakhir Manusia" dengan alat mencetak 60.0 poin, membalikkan 57.9 poin Opus 4.8, dan terus mendekati 63.0 poin Fable 5.
Bahkan dalam agen rekayasa perangkat lunak yang sebelumnya paling lemah, DeepSWE melonjak dari 12.8 poin versi pratinjau menjadi 62.7 poin, hampir 4.9 kali lipat dari sebelumnya.
Prestasi ini tidak hanya mengungguli 58.0 poin Opus 4.8, tetapi juga hanya tertinggal 7.3 poin dari 70.0 poin Fable 5.

Pada waktu yang bersamaan, Musk juga "menggoreng" Fable 5 dan GPT-5.6 Sol.
Grok 4.6 pertama-tama menyamai kemampuan komprehensif GPT-5.6, kemudian secara berturut-turut membalikkan dalam uji pengkodean.
Dalam Indeks Kecerdasan Komprehensif mencetak 61 poin, hanya terpaut 1 poin dari 62 poin Fable 5.
Di CursorBench mencetak 69.9%, mengungguli 67.2% GPT-5.6, dan hanya terpaut 0.6 poin persentase dari 70.5% Fable 5.
Di FrontierCode mencetak 61.3%, juga mengungguli 60.6% GPT-5.6, terus mengejar ketat 63.6% Fable 5.
Saat beralih ke pekerjaan berbasis pengetahuan yang lebih mendekati penyampaian nyata di dunia kerja, Grok 4.6 langsung berbalik membalikkan, meraih posisi pertama di ketiga evaluasi.
Di GDPval-AA v2 mencetak 1753 Elo, mengungguli 1741 Fable 5, juga mengungguli 1728 GPT-5.6.
Di AA-Briefcase kembali mencetak 1577 Elo, mengungguli 1574 Fable 5 dan 1502 GPT-5.6.
Dalam tugas hukum profesional Harvey LAB mencetak 15.8%, sementara Fable 5 hanya 11.3%, dan GPT-5.6 bahkan hanya 2.5%.

Yang lebih tajam lagi, DeepSeek V4 Pro dan Grok 4.6 tidak hanya mendekati model puncak OpenAI dan Anthropic dalam performa, tetapi juga bersama-sama menekan harga kecerdasan mutakhir.
Per juta Token keluaran, Grok 4.6 membutuhkan $6, GPT-5.6 Sol $30, Claude Opus 5 $25, Fable 5 $50.
Sementara DeepSeek hanya $0.87—
sekitar 1/7 dari Grok 4.6, 1/35 dari GPT-5.6 Sol, 1/29 dari Claude Opus 5, 1/57 dari Fable 5!


Uji Pertama di Seluruh Jaringan
DeepSeek vs Grok
Sekarang, hasil uji nyata pertama telah keluar. DeepSeek V4 Pro dan Grok 4.6 akhirnya memasuki medan tugas nyata dari papan peringkat.
Putaran pertama, kami langsung memberikan tekanan pada DeepSeek.
Hanya dengan satu petunjuk, ia membangun sebuah bola dunia 3D interaktif lengkap dari nol di browser.
Interaksi dasar seperti drag, rotate, zoom semuanya dapat digunakan; aliran data global, rute dinamis, dan penanda geografis juga terpasang lengkap di permukaan bumi.
Melihat lebih detail, hamburan atmosfer, rendering awan, pencahayaan siang-malam, hingga seluruh antarmuka UI, semuanya lengkap.

Selanjutnya, langsung tarik kedua model ke dalam ring yang sama.
Bloger AI "Xiang Yang Qiao Mu" pertama menggunakan DeepSeek V4 Pro untuk menjalankan tiga tugas kecil berturut-turut, kemudian memberikan petunjuk yang sama untuk dua soal kepada Grok 4.6, langsung membandingkan produk akhir.
Tugas pertama adalah memanggil 3 Skill untuk mengembangkan dan menyebarkan sebuah situs web.
DeepSeek berhasil menjalankan seluruh alur proses, dari desain halaman dan kelengkapan, kinerja keseluruhannya sangat stabil.
Tugas kedua adalah mereplikasi 60 gaya desain sekaligus, dan menghasilkan serangkaian lengkap kartu Bento untuk ditampilkan.
Pada putaran ini, DeepSeek membuat pembedaan yang jelas dalam font, skema warna, dan tata letak, efek visual keseluruhannya cukup bagus.
Tugas terakhir adalah menghasilkan game blok breaker 3D dari nol.
Game tidak hanya dapat langsung dimainkan, tetapi juga menambahkan adegan 3D, musik latar, dan efek suara dinamis, dengan umpan balik operasi dan kegunaan yang semua berfungsi.



Kemudian, petunjuk yang sama diberikan kepada Grok 4.6.
Dalam permainan blok breaker 3D ini, kedua model hampir imbang.
Game yang dihasilkan Grok juga memiliki kualitas visual yang baik, baik dari segi efek visual, kelengkapan adegan, maupun kegunaan, tidak kalah dengan DeepSeek V4 Pro.
Pada putaran 60 desain Bento, Grok 4.6 membalikkan satu poin.
Beberapa halaman yang dihasilkannya lebih matang dalam tata letak, skema warna, dan hierarki visual, dengan efek akhir yang lebih menarik.


Pertarungan yang lebih sengit terjadi di Flappy Bird.
Pengembang Jun Song memberikan petunjuk yang persis sama, meminta DeepSeek V4 Pro dan Grok 4.6 masing-masing "membuat" sebuah game dari nol.
Hasilnya, kedua model mengambil jalur yang sangat berbeda.
DeepSeek V4 Pro mengonsumsi lebih dari 20.000 Token, dengan biaya hanya $0.019; Grok 4.6 hanya menggunakan sekitar 5000 Token, tetapi biayanya mencapai $0.03.

Tetapi dari produk akhir, pada putaran ini DeepSeek jelas lebih unggul.
Dalam game tidak hanya ada pemandangan pegunungan jauh dan awan berlapis, pipa juga memiliki gradien dan rasa volume. Saat karakter melewati pipa, layar bahkan muncul animasi mengambang "+1".
Dari hierarki adegan hingga umpan balik operasi, detail hampir semuanya maksimal, kelengkapan konstruksi ujung-ke-ujung jelas lebih tinggi daripada Grok 4.6.
Dalam uji frontend lain yang dilakukan pengembang Hamza, DeepSeek V4 Pro kembali mengalahkan Grok 4.6.
Baik dari kelengkapan halaman maupun efek visual akhir, produk yang diserahkan V4 Pro lebih unggul.

Namun, V4 Pro juga tidak selalu sempurna.
Dalam satu set uji perbandingan burung pelikan, dibandingkan versi Flash, tingkat kelengkapan keseluruhan gambar V4 Pro lebih tinggi, bentuk gajah juga lebih indah.
Satu-satunya masalah adalah—arah gerakan burung pelikan digambar sepenuhnya terbalik.

Terus meningkatkan kesulitan, meminta DeepSeek V4 Pro, GPT-5.6 Sol, dan Claude Opus 5 menggunakan Three.js untuk menghasilkan pohon sakura yang sama, perbedaannya menjadi lebih jelas.
Baik dari detail batang dan ranting, maupun pencahayaan, depth of field, dan suasana keseluruhan, V4 Pro tidak sebaik dua model puncak lainnya.



DeepSeek V4 Pro; GPT-5.6 Sol; Claude Opus 5
Setelah beberapa putaran uji nyata, DeepSeek V4 Pro dan Grok 4.6 memang sudah mencapai tingkat yang sama, sulit dibedakan.
Dua AI Besar di Hari yang Sama
Mengejar OpenAI dan Anthropic
Mengenai ledakan simultan kedua model ini, komentar yang diberikan oleh Rick De Oliveira adalah, "Kuat, dan terjangkau."
Dengan dukungan DeepSeek V4 Pro dan Grok 4.6, dua kata yang hampir mustahil muncul bersamaan ini, hari ini, untuk pertama kalinya benar-benar bersatu.
Dari keamanan siber, tugas berbasis pengetahuan, hingga agen yang secara mandiri memecahkan masalah, mereka sudah berada di banyak medan pertempuran, dengan biaya yang lebih rendah langsung menghancurkan langit-langit kemampuan mutakhir.

Melihat kembali "tembakan" AI yang magis hari ini, DeepSeek dan Grok bersama-sama mengubah satu aturan permainan:
Kecerdasan puncak, tidak lagi tak terjangkau.
Di masa lalu, pengembang sering kali harus memilih dengan sulit antara "tidak mampu membeli" dan "tidak cukup kuat".
Dan hari ini, DeepSeek menggulingkan meja dengan harga hanya sepersekian puluh dari SOTA, sementara Grok mengikuti dengan rasio harga-kinerja yang sangat tinggi.
Gempuran langsung "kinerja tinggi harga rendah" ini sudah merobek celah dalam tatanan lama.

Dan perang belum berakhir.
Musk sudah mengumumkan sebelumnya, Grok 4.7 akan segera datang, menargetkan melampaui semua AI puncak; serangan balik dari OpenAI dan Anthropic juga pasti akan menyusul.


Berada di era yang berevolusi dengan unit "jam" ini, kecerdasan bukan lagi hak istimewa segelintir raksasa, ledakan aplikasi untuk semua orang, baru saja dimulai.
Referensi:
https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
https://x.ai/news/grok-4-6
https://x.com/vista8/status/2087577905081823559
https://x.com/vista8/status/2087566666477744620
https://x.com/jun_song/status/2087602149979254914
Artikel ini berasal dari akun WeChat publik "Xin Zhi Yuan", penulis: ASI Qishilu, editor: Moses Taozi






