GPT-5.6 Segera Hadir, Kecepatan Penalaran Melesat 750 Token/detik, Diduga Menjangkau 100 Wafer
Berdasarkan berbagai sumber, GPT-5.6 Sol, model AI terbaru OpenAI, akan segera diluncurkan dengan kecepatan inferensi yang mencengangkan mencapai 750 token per detik. Kecepatan ini diklaim mampu menghasilkan ratusan karakter hanya dalam sepersekian detik, menandai lompatan besar menuju era kecerdasan real-time.
Kunci dari pencapaian ini adalah kolaborasi OpenAI dengan Cerebras. GPT-5.6 Sol yang diduga memiliki triliunan parameter, tidak dijalankan pada chip tunggal, melainkan didistribusikan secara spektakuler di 70 hingga 100 wafer chip Cerebras. Pendekatan "satu wafer, satu lapisan jaringan" ini memungkinkan model berukuran raksasa dijalankan dengan lancar. Selain itu, untuk mengoptimalkan arsitektur perangkat keras, OpenAI diduga melakukan restrukturisasi model, seperti mengadopsi cache KV yang lebih ringan atau desain perhatian hibrida, agar sesuai dengan memori SRAM pada chip Cerebras.
Langkah strategis ini memperlihatkan ambisi OpenAI untuk membangun ekosistem AI full-stack. Dukungan lebih lanjut datang dengan peluncuran chip inferensi AI buatan sendiri pertama mereka, Jalapeño, yang dikembangkan khusus untuk menjalankan model besar. Dengan mengontrol rantai pasok dari model, chip, hingga optimasi dan deployment, OpenAI bertekad mendobrak batas fisik antara ukuran parameter dan kecepatan inferensi, membuka babak baru dalam komputasi AI.
marsbit07/09 11:57