16 Kartu B200 Dibutuhkan untuk Menjalankan Kimi K3, Hanya 8 Kartu AMD yang Diperlukan
Ini mungkin momen yang sudah lama ditunggu AMD. Baru-baru ini, Wafer AI berhasil menerapkan model **Kimi K3** pada GPU AMD MI355X. Hasilnya, model yang sebelumnya membutuhkan 16 GPU NVIDIA B200 yang dijalankan di dua server, kini dapat dijalankan di satu server AMD dengan 8 MI355X.
Kunci utamanya adalah kapasitas memori. Kimi K3 memiliki 2,8 triliun parameter dan membutuhkan lebih dari 1,5 TB memori hanya untuk bobot modelnya. Server 8-kartu B200 dengan 192 GB per kartu hampir tidak cukup, sehingga memerlukan dua server. Sementara MI355X, dengan 288 GB memori per kartu, memungkinkan seluruh model berjalan dalam satu node, menghindari latensi komunikasi antar-node.
Dalam pengujian (input 1024 token, output 400 token), konfigurasi 8 MI355X mencapai throughput total puncak 952 token/detik dan kecepatan generasi per pengguna 118 token/detik. Performa throughput per node ini sekitar 3,8 kali lebih tinggi dari rata-rata konfigurasi dua node B200. Meskipun B300 tetap lebih cepat secara absolut, analisis biaya-performa oleh Wafer (dengan asumsi harga tertentu per jam) menunjukkan MI355X menawarkan efisiensi biaya tertinggi.
Yang mengejutkan, pengalaman dengan platform perangkat lunak ROCm AMD kali ini relatif mulus. Model Kimi K3 dapat berjalan langsung di MI355X dengan dukungan yang hampir bersamaan. Hanya beberapa penyesuaian kecil yang diperlukan, seperti menambahkan fungsi yang hilang untuk *speculative decoding* dan mengoptimalkan kernel perhatian (*attention kernel*) untuk bentuk spesifik model, yang berhasil mengurangi waktu hingga token pertama (*TTFT*) secara signifikan.
Meskipun ekosistem CUDA NVIDIA masih lebih matang, kasus ini menunjukkan bahwa strategi AMD dengan memori HBM yang lebih besar menjadi keunggulan nyata untuk model besar. Jika AMD dapat terus meningkatkan stabilitas ROCm dan dukungan bentuk model, GPU mereka menjadi alternatif yang layak dipertimbangkan untuk *data center*: harga lebih rendah, memori lebih besar, performa memadai, dan perangkat lunak yang semakin tidak merepotkan.
marsbit08/04 11:24