Dalam Semalam, GPT-5.6 Sol Dipercepat 14 Kali Lipat oleh OpenAI

marsbit发布于2026-08-14更新于2026-08-14

文章摘要

AI mulai bersaing dalam asimetri informasi? Pada 14 Agustus, OpenAI bersama Cerebras meluncurkan mode pratinjau "Ultrafast" untuk model andalannya GPT-5.6 Sol. Mode ini meningkatkan kecepatan output hingga 750 token/detik, atau 14 kali lebih cepat dari mode standar (53 token/detik), tanpa mengurangi kualitas. Dibandingkan model lain, GPT-5.6 Sol Ultrafast 11 kali lebih cepat dari Fable 5 dan 5 kali lebih cepat dari Opus 4.8 Fast Mode. Dalam tes "Ujian Terakhir Manusia" (HLE) yang menantang, GPT-5.6 Sol menyelesaikan 2500 soal hanya dalam 11 jam 11 menit, sementara Claude Fable 5 membutuhkan 78 jam 27 menit. Peningkatan kecepatan ini juga menghasilkan percepatan 5,6 kali dalam tugas bernilai ekonomi pada benchmark GDP-Val. Peningkatan drastis ini dimungkinkan berkat arsitektur hardware wafer-scale Cerebras (WSE-3), yang mengatasi hambatan bandwidth memori pada GPU tradisional dengan menyimpan parameter model di SRAM on-chip berkecepatan tinggi, menghilangkan waktu tunggu untuk memuat berat model. Mode Ultrafast membuka kemungkinan alur kerja baru, seperti: tanggap insiden & keandalan sistem, penelitian keamanan finansial real-time, dukungan pelanggan yang kompleks, asistensi belanja, serta penelitian dan eksperimen interaktif yang dipercepat. Perubahan ini memungkinkan tugas agen AI multi-langkah yang sebelumnya memakan jam dapat diselesaikan dalam hitungan menit, dan menggeser cara kita berinteraksi dengan AI. Komunitas kini menantikan versi Ultrafast untuk model tingkat m...

AI Mulai Memperbesar Ketimpangan Informasi?

Pada dini hari 14 Agustus, OpenAI bersama dengan produsen chip AI Cerebras secara resmi mempratinjau lapisan layanan baru "Mode Super Cepat" (Ultrafast Mode) untuk model andalan mereka GPT-5.6 Sol.

Dalam mode ini, kecepatan keluaran GPT-5.6 Sol dapat mencapai hingga 750 tokens/detik, dibandingkan dengan baseline inferensi Mode Standar saat ini yang sekitar 53 tokens/detik, peningkatan kecepatan mencapai hingga 14 kali lipat, tanpa mengurangi kualitas apa pun. Secara perbandingan horizontal, GPT-5.6 Sol yang dipercepat 11 kali lebih cepat dari Fable 5, dan 5 kali lebih cepat dari Opus 4.8 dalam mode Cepat.

Mode Ultrafast akan diluncurkan terlebih dahulu di OpenAI API, dan saat ini telah dirilis dalam pratinjau terbatas untuk sebagian pelanggan.

Untuk itu, OpenAI dan Cerebras juga membuat tabel perbandingan kecepatan dan kecerdasan model AI besar mutakhir saat ini, di mana GPT-5.6 Sol Ultrafast berada di posisi yang sangat unggul:

Dalam blog Cerebras, para insinyur memperkenalkan tes yang dilakukan pada "Ujian Terakhir Manusia" (Humanity's Last Exam, HLE), di mana mereka membandingkan model yang telah di-Ultrafast-kan dengan pesaing langsungnya. Kita tahu, HLE adalah tolok ukur model yang menantang, berisi 2500 soal, yang biasanya hanya dapat dijawab oleh doktor di bidang kimia, ekonomi, dan sastra.

GPT-5.6 Sol dalam mode super cepat hanya membutuhkan 11 jam 11 menit untuk menjawab semua pertanyaan. Sedangkan Claude Fable 5 membutuhkan 78 jam 27 menit, yaitu lebih dari tiga hari komputasi berkelanjutan untuk mencapai kesimpulan yang sama. Mode super cepat GPT hanya membutuhkan satu hari kerja untuk menyelesaikan bidang pengetahuan manusia yang paling mutakhir, dengan akurasi yang serupa, kecepatannya hampir 7 kali lipat dari Claude Fable.

Seiring peningkatan kemampuan model, cakupan aplikasi inferensi cepat juga akan meluas. GPT-5.6 Sol adalah model terbaik OpenAI sejauh ini dalam dokumen hukum, model keuangan, dan laporan teknik. Pada GDP-Val (tolok ukur untuk mengukur tugas pekerjaan pengetahuan bernilai ekonomi), Ultrafast mencapai peningkatan kecepatan end-to-end 5,6 kali lipat tanpa penurunan kualitas, menunjukkan sepenuhnya bagaimana kecepatan inferensi yang lebih cepat dapat mempercepat pelaksanaan pekerjaan bernilai ekonomi.

Pemrosesan AI yang lebih cepat menambah banyak kemungkinan untuk alur kerja baru, orang sekarang dapat mengerahkan agen ke jalur kritis masalah. OpenAI mencantumkan beberapa skenario aplikasi untuk Anda:

  • Respon dan Keandalan Insiden: Ketika sistem kritis mengalami kegagalan, AI menganalisis log aplikasi, perubahan kode terbaru, dan laporan insinyur untuk menentukan kemungkinan penyebab, dan membantu menyiapkan rencana perbaikan sementara kegagalan masih terjadi.
  • Penelitian dan Keamanan Finansial: Menganalisis sinyal pasar, mengevaluasi perdagangan, dan mengidentifikasi aktivitas mencurigakan dalam situasi pasar yang berubah dengan cepat.
  • Dukungan dan Suara Pelanggan: Menyelesaikan masalah pelanggan yang kompleks secara real-time, bahkan jika menemukan jawaban memerlukan banyak langkah atau sistem, tanpa mengganggu percakapan.
  • Perdagangan: Menjawab pertanyaan produk, memeriksa persediaan, merekomendasikan personalisasi, dan menyelesaikan masalah checkout saat pembeli masih ragu-ragu, mencegah keraguan berkembang menjadi shopping cart yang ditinggalkan.
  • Penelitian dan Eksperimen Real-Time: Mengubah penelitian yang sebelumnya memerlukan waktu semalam menjadi rapat kerja interaktif, memungkinkan tim menguji ide, memeriksa hasil, menyesuaikan metode, dan melakukan eksperimen lain tanpa mengganggu alur kerja.

Di internal OpenAI, pengembang menguji GPT-5.6 Sol dalam mode super cepat, respon insiden adalah contoh penggunaan Ultrafast. Saat alarm terpicu, insinyur perlu membangun gambaran insiden yang akurat sementara sistem dan bukti masih berubah. Dengan kecerdasan tingkat Sol, tim dapat membaca log dengan cepat, menganalisis jejak, merangkum percakapan, menentukan pemeriksaan selanjutnya, dan membantu menyiapkan atau memvalidasi rencana perbaikan. Mode Ultrafast memperpendek jeda antara mengamati sinyal, memvalidasi hipotesis, dan memilih tindakan selanjutnya, sementara insinyur tetap bertanggung jawab atas penilaian dan penerapan.

Dalam hal penelitian, tim OpenAI menggunakan Ultrafast untuk mencari basis pengetahuan dengan cepat, mengkueri data, dan mengumpulkan, menyusun, dan merangkum informasi dari berbagai alat dengan cepat. Alur kerja umum dalam penelitian sebelumnya adalah, anggota tim memulai sekumpulan eksperimen di malam hari, dan melihat hasilnya keesokan paginya. Dengan Ultrafast, proses penemuan dapat dipersingkat, sehingga mendukung banyak iterasi dalam satu hari kerja.

Terobosan mode Ultrafast terletak pada pemecahan hambatan bandwidth memori kluster GPU tradisional dalam tahap dekoding inferensi model besar, implementasinya terutama bergantung pada arsitektur hardware tingkat wafer Cerebras.

Di antara produsen chip AI, solusi Cerebras sangat unik: chip generasinya dibuat menggunakan wafer utuh, mengintegrasikan sejumlah besar inti komputasi dan jaringan interkoneksi berkecepatan sangat tinggi dalam satu chip.

GPU tradisional saat menjalankan dekoding autoregresif model besar untuk menghasilkan Token, dibatasi oleh bandwidth memori, perlu terus-menerus memindahkan bobot model yang besar antara HBM di luar chip dan inti komputasi; sementara pemisahan multi-kartu juga akan membawa penundaan komunikasi interkoneksi antar chip (PCIe/NVLink).

Sedangkan setiap chip tingkat wafer terbaru Cerebras (WSE-3) mengintegrasikan 4 triliun transistor, 125 petaflops daya komputasi AI, dan hingga 44 GB SRAM kecepatan tinggi di atas chip. Parameter model langsung tinggal di SRAM di atas chip dengan bandwidth sangat tinggi, menghindari waktu tunggu untuk memuat bobot berulang kali dari memori di luar chip.

Tentu saja, GPT-5.6 Sol sebagai model andalan mutakhir, jumlah parameter lengkapnya jelas jauh melebihi kapasitas chip. Cerebras juga memiliki mekanisme "Paralelisme Pipeline Multi-Wafer" (Pipelined across wafers), yang mendistribusikan setiap lapisan jaringan model ke beberapa wafer, parameter setiap lapisan tinggal di SRAM chip masing-masing, memungkinkan Token ditransmisikan dengan mulus antar wafer dalam pipeline.

Bagi banyak pengguna model besar, kecepatan 14 kali lipat model andalan berarti bahwa banyak tugas yang sebelumnya harus dialihkan ke model sekunder (seperti Luna dan Terra) sekarang dapat dijalankan dengan kekuatan penuh dengan percaya diri. Untuk tugas Agen yang memerlukan banyak panggilan alat, pembuatan kode dan debugging, serta pemikiran berantai yang kompleks, proses yang sebelumnya memerlukan beberapa jam dapat dikompresi menjadi beberapa menit.

Kecepatan yang lebih cepat mungkin juga berarti cara kita menggunakan AI berubah:

Di komunitas AI, orang sudah menantikan mode super cepat versi Luna dan Terra, hanya saja tidak tahu apakah chip Cerebras cukup tersedia.

Referensi:

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Artikel ini dari akun WeChat "机器之心" (ID:almosthuman2014), penulis: 关注大模型的机器之心

热门币种推荐

相关问答

QApa yang diumumkan OpenAI dan Cerebras terkait GPT-5.6 Sol, dan berapa peningkatan kecepatan yang dicapai?

AOpenAI bersama Cerebras meluncurkan mode 'Ultrafast' untuk model GPT-5.6 Sol. Mode ini dapat mencapai kecepatan hingga 750 token/detik, peningkatan 14 kali lipat dibanding mode standar yang sekitar 53 token/detik.

QBagaimana kinerja GPT-5.6 Sol Ultrafast dibandingkan dengan model pesaing seperti Claude Fable 5 dalam ujian HLE?

APada ujian HLE (Humanity's Last Exam), GPT-5.6 Sol Ultrafast menyelesaikan 2500 soal hanya dalam 11 jam 11 menit. Sementara itu, Claude Fable 5 membutuhkan waktu 78 jam 27 menit, menjadikan Sol Ultrafast hampir 7 kali lebih cepat.

QApa saja contoh aplikasi yang disebutkan OpenAI untuk kecepatan tinggi GPT-5.6 Sol Ultrafast?

AContoh aplikasinya meliputi: respons dan keandalan peristiwa, riset dan keamanan keuangan, dukungan dan suara pelanggan, bisnis (seperti rekomendasi produk), serta penelitian dan eksperimen waktu nyata yang memungkinkan interaksi dan iterasi lebih cepat.

QApa yang menjadi terobosan teknologi di balik mode Ultrafast, dan bagaimana peran Cerebras?

ATerobosan utama adalah mengatasi hambatan bandwidth memori dalam proses decoding model besar. Cerebras berkontribusi dengan arsitektur chip skala wafer (WSE-3) yang menyimpan seluruh parameter model di SRAM on-chip berkecepatan tinggi, menghilangkan penundaan akibat memuat ulang bobot dari memori eksternal.

QApa dampak kecepatan 14 kali lipat ini bagi pengguna dan pengembang AI?

AKecepatan ini memungkinkan tugas kompleks yang sebelumnya memerlukan model sekunder atau waktu berjam-jam (seperti pemanggilan alat berantai atau debugging kode) dapat diselesaikan dalam hitungan menit dengan model unggulan, serta mengubah cara kerja dengan mendukung iterasi lebih cepat dalam alur kerja sehari-hari.

你可能也喜欢

交易

现货

热门文章

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对SOL(SOL)币价的意见。

活动图片