Dalam Semalam, GPT-5.6 Sol Dipercepat 14 Kali Lipat oleh OpenAI

marsbitPublished on 2026-08-14Last updated on 2026-08-14

Abstract

AI mulai bersaing dalam asimetri informasi? Pada 14 Agustus, OpenAI bersama Cerebras meluncurkan mode pratinjau "Ultrafast" untuk model andalannya GPT-5.6 Sol. Mode ini meningkatkan kecepatan output hingga 750 token/detik, atau 14 kali lebih cepat dari mode standar (53 token/detik), tanpa mengurangi kualitas. Dibandingkan model lain, GPT-5.6 Sol Ultrafast 11 kali lebih cepat dari Fable 5 dan 5 kali lebih cepat dari Opus 4.8 Fast Mode. Dalam tes "Ujian Terakhir Manusia" (HLE) yang menantang, GPT-5.6 Sol menyelesaikan 2500 soal hanya dalam 11 jam 11 menit, sementara Claude Fable 5 membutuhkan 78 jam 27 menit. Peningkatan kecepatan ini juga menghasilkan percepatan 5,6 kali dalam tugas bernilai ekonomi pada benchmark GDP-Val. Peningkatan drastis ini dimungkinkan berkat arsitektur hardware wafer-scale Cerebras (WSE-3), yang mengatasi hambatan bandwidth memori pada GPU tradisional dengan menyimpan parameter model di SRAM on-chip berkecepatan tinggi, menghilangkan waktu tunggu untuk memuat berat model. Mode Ultrafast membuka kemungkinan alur kerja baru, seperti: tanggap insiden & keandalan sistem, penelitian keamanan finansial real-time, dukungan pelanggan yang kompleks, asistensi belanja, serta penelitian dan eksperimen interaktif yang dipercepat. Perubahan ini memungkinkan tugas agen AI multi-langkah yang sebelumnya memakan jam dapat diselesaikan dalam hitungan menit, dan menggeser cara kita berinteraksi dengan AI. Komunitas kini menantikan versi Ultrafast untuk model tingkat m...

AI Mulai Memperbesar Ketimpangan Informasi?

Pada dini hari 14 Agustus, OpenAI bersama dengan produsen chip AI Cerebras secara resmi mempratinjau lapisan layanan baru "Mode Super Cepat" (Ultrafast Mode) untuk model andalan mereka GPT-5.6 Sol.

Dalam mode ini, kecepatan keluaran GPT-5.6 Sol dapat mencapai hingga 750 tokens/detik, dibandingkan dengan baseline inferensi Mode Standar saat ini yang sekitar 53 tokens/detik, peningkatan kecepatan mencapai hingga 14 kali lipat, tanpa mengurangi kualitas apa pun. Secara perbandingan horizontal, GPT-5.6 Sol yang dipercepat 11 kali lebih cepat dari Fable 5, dan 5 kali lebih cepat dari Opus 4.8 dalam mode Cepat.

Mode Ultrafast akan diluncurkan terlebih dahulu di OpenAI API, dan saat ini telah dirilis dalam pratinjau terbatas untuk sebagian pelanggan.

Untuk itu, OpenAI dan Cerebras juga membuat tabel perbandingan kecepatan dan kecerdasan model AI besar mutakhir saat ini, di mana GPT-5.6 Sol Ultrafast berada di posisi yang sangat unggul:

Dalam blog Cerebras, para insinyur memperkenalkan tes yang dilakukan pada "Ujian Terakhir Manusia" (Humanity's Last Exam, HLE), di mana mereka membandingkan model yang telah di-Ultrafast-kan dengan pesaing langsungnya. Kita tahu, HLE adalah tolok ukur model yang menantang, berisi 2500 soal, yang biasanya hanya dapat dijawab oleh doktor di bidang kimia, ekonomi, dan sastra.

GPT-5.6 Sol dalam mode super cepat hanya membutuhkan 11 jam 11 menit untuk menjawab semua pertanyaan. Sedangkan Claude Fable 5 membutuhkan 78 jam 27 menit, yaitu lebih dari tiga hari komputasi berkelanjutan untuk mencapai kesimpulan yang sama. Mode super cepat GPT hanya membutuhkan satu hari kerja untuk menyelesaikan bidang pengetahuan manusia yang paling mutakhir, dengan akurasi yang serupa, kecepatannya hampir 7 kali lipat dari Claude Fable.

Seiring peningkatan kemampuan model, cakupan aplikasi inferensi cepat juga akan meluas. GPT-5.6 Sol adalah model terbaik OpenAI sejauh ini dalam dokumen hukum, model keuangan, dan laporan teknik. Pada GDP-Val (tolok ukur untuk mengukur tugas pekerjaan pengetahuan bernilai ekonomi), Ultrafast mencapai peningkatan kecepatan end-to-end 5,6 kali lipat tanpa penurunan kualitas, menunjukkan sepenuhnya bagaimana kecepatan inferensi yang lebih cepat dapat mempercepat pelaksanaan pekerjaan bernilai ekonomi.

Pemrosesan AI yang lebih cepat menambah banyak kemungkinan untuk alur kerja baru, orang sekarang dapat mengerahkan agen ke jalur kritis masalah. OpenAI mencantumkan beberapa skenario aplikasi untuk Anda:

  • Respon dan Keandalan Insiden: Ketika sistem kritis mengalami kegagalan, AI menganalisis log aplikasi, perubahan kode terbaru, dan laporan insinyur untuk menentukan kemungkinan penyebab, dan membantu menyiapkan rencana perbaikan sementara kegagalan masih terjadi.
  • Penelitian dan Keamanan Finansial: Menganalisis sinyal pasar, mengevaluasi perdagangan, dan mengidentifikasi aktivitas mencurigakan dalam situasi pasar yang berubah dengan cepat.
  • Dukungan dan Suara Pelanggan: Menyelesaikan masalah pelanggan yang kompleks secara real-time, bahkan jika menemukan jawaban memerlukan banyak langkah atau sistem, tanpa mengganggu percakapan.
  • Perdagangan: Menjawab pertanyaan produk, memeriksa persediaan, merekomendasikan personalisasi, dan menyelesaikan masalah checkout saat pembeli masih ragu-ragu, mencegah keraguan berkembang menjadi shopping cart yang ditinggalkan.
  • Penelitian dan Eksperimen Real-Time: Mengubah penelitian yang sebelumnya memerlukan waktu semalam menjadi rapat kerja interaktif, memungkinkan tim menguji ide, memeriksa hasil, menyesuaikan metode, dan melakukan eksperimen lain tanpa mengganggu alur kerja.

Di internal OpenAI, pengembang menguji GPT-5.6 Sol dalam mode super cepat, respon insiden adalah contoh penggunaan Ultrafast. Saat alarm terpicu, insinyur perlu membangun gambaran insiden yang akurat sementara sistem dan bukti masih berubah. Dengan kecerdasan tingkat Sol, tim dapat membaca log dengan cepat, menganalisis jejak, merangkum percakapan, menentukan pemeriksaan selanjutnya, dan membantu menyiapkan atau memvalidasi rencana perbaikan. Mode Ultrafast memperpendek jeda antara mengamati sinyal, memvalidasi hipotesis, dan memilih tindakan selanjutnya, sementara insinyur tetap bertanggung jawab atas penilaian dan penerapan.

Dalam hal penelitian, tim OpenAI menggunakan Ultrafast untuk mencari basis pengetahuan dengan cepat, mengkueri data, dan mengumpulkan, menyusun, dan merangkum informasi dari berbagai alat dengan cepat. Alur kerja umum dalam penelitian sebelumnya adalah, anggota tim memulai sekumpulan eksperimen di malam hari, dan melihat hasilnya keesokan paginya. Dengan Ultrafast, proses penemuan dapat dipersingkat, sehingga mendukung banyak iterasi dalam satu hari kerja.

Terobosan mode Ultrafast terletak pada pemecahan hambatan bandwidth memori kluster GPU tradisional dalam tahap dekoding inferensi model besar, implementasinya terutama bergantung pada arsitektur hardware tingkat wafer Cerebras.

Di antara produsen chip AI, solusi Cerebras sangat unik: chip generasinya dibuat menggunakan wafer utuh, mengintegrasikan sejumlah besar inti komputasi dan jaringan interkoneksi berkecepatan sangat tinggi dalam satu chip.

GPU tradisional saat menjalankan dekoding autoregresif model besar untuk menghasilkan Token, dibatasi oleh bandwidth memori, perlu terus-menerus memindahkan bobot model yang besar antara HBM di luar chip dan inti komputasi; sementara pemisahan multi-kartu juga akan membawa penundaan komunikasi interkoneksi antar chip (PCIe/NVLink).

Sedangkan setiap chip tingkat wafer terbaru Cerebras (WSE-3) mengintegrasikan 4 triliun transistor, 125 petaflops daya komputasi AI, dan hingga 44 GB SRAM kecepatan tinggi di atas chip. Parameter model langsung tinggal di SRAM di atas chip dengan bandwidth sangat tinggi, menghindari waktu tunggu untuk memuat bobot berulang kali dari memori di luar chip.

Tentu saja, GPT-5.6 Sol sebagai model andalan mutakhir, jumlah parameter lengkapnya jelas jauh melebihi kapasitas chip. Cerebras juga memiliki mekanisme "Paralelisme Pipeline Multi-Wafer" (Pipelined across wafers), yang mendistribusikan setiap lapisan jaringan model ke beberapa wafer, parameter setiap lapisan tinggal di SRAM chip masing-masing, memungkinkan Token ditransmisikan dengan mulus antar wafer dalam pipeline.

Bagi banyak pengguna model besar, kecepatan 14 kali lipat model andalan berarti bahwa banyak tugas yang sebelumnya harus dialihkan ke model sekunder (seperti Luna dan Terra) sekarang dapat dijalankan dengan kekuatan penuh dengan percaya diri. Untuk tugas Agen yang memerlukan banyak panggilan alat, pembuatan kode dan debugging, serta pemikiran berantai yang kompleks, proses yang sebelumnya memerlukan beberapa jam dapat dikompresi menjadi beberapa menit.

Kecepatan yang lebih cepat mungkin juga berarti cara kita menggunakan AI berubah:

Di komunitas AI, orang sudah menantikan mode super cepat versi Luna dan Terra, hanya saja tidak tahu apakah chip Cerebras cukup tersedia.

Referensi:

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Artikel ini dari akun WeChat "机器之心" (ID:almosthuman2014), penulis: 关注大模型的机器之心

Trending Cryptos

Related Questions

QApa yang diumumkan OpenAI dan Cerebras terkait GPT-5.6 Sol, dan berapa peningkatan kecepatan yang dicapai?

AOpenAI bersama Cerebras meluncurkan mode 'Ultrafast' untuk model GPT-5.6 Sol. Mode ini dapat mencapai kecepatan hingga 750 token/detik, peningkatan 14 kali lipat dibanding mode standar yang sekitar 53 token/detik.

QBagaimana kinerja GPT-5.6 Sol Ultrafast dibandingkan dengan model pesaing seperti Claude Fable 5 dalam ujian HLE?

APada ujian HLE (Humanity's Last Exam), GPT-5.6 Sol Ultrafast menyelesaikan 2500 soal hanya dalam 11 jam 11 menit. Sementara itu, Claude Fable 5 membutuhkan waktu 78 jam 27 menit, menjadikan Sol Ultrafast hampir 7 kali lebih cepat.

QApa saja contoh aplikasi yang disebutkan OpenAI untuk kecepatan tinggi GPT-5.6 Sol Ultrafast?

AContoh aplikasinya meliputi: respons dan keandalan peristiwa, riset dan keamanan keuangan, dukungan dan suara pelanggan, bisnis (seperti rekomendasi produk), serta penelitian dan eksperimen waktu nyata yang memungkinkan interaksi dan iterasi lebih cepat.

QApa yang menjadi terobosan teknologi di balik mode Ultrafast, dan bagaimana peran Cerebras?

ATerobosan utama adalah mengatasi hambatan bandwidth memori dalam proses decoding model besar. Cerebras berkontribusi dengan arsitektur chip skala wafer (WSE-3) yang menyimpan seluruh parameter model di SRAM on-chip berkecepatan tinggi, menghilangkan penundaan akibat memuat ulang bobot dari memori eksternal.

QApa dampak kecepatan 14 kali lipat ini bagi pengguna dan pengembang AI?

AKecepatan ini memungkinkan tugas kompleks yang sebelumnya memerlukan model sekunder atau waktu berjam-jam (seperti pemanggilan alat berantai atau debugging kode) dapat diselesaikan dalam hitungan menit dengan model unggulan, serta mengubah cara kerja dengan mendukung iterasi lebih cepat dalam alur kerja sehari-hari.

Related Reads

Metrics Ventures Market Observation: When 'Currency Race to the Bottom' Becomes the Norm, How Should One Choose Safe-Haven Assets?

Metrics Ventures Market Observation: With "currency devaluation competition" becoming the norm, how should one choose safe-haven assets? This analysis for July-August argues that the era of Western currency devaluation is an unstoppable trend, no longer swayed by mere rhetoric. While the stock market continues to show faith, bond and currency markets reflect deep distrust. Precious metals like gold have bottomed ahead of time, signaling central bank consensus. Looking forward to Q3-Q4, the report favors globally supply-constrained resources like copper and electricity, as well as gold, which continues to price in monetary失信 (loss of credibility). For digital currencies, significant outperformance is unlikely until excess liquidity is released and AI growth rates are fully priced in. Regarding market movements: 1) Commodities like gold remain priority assets for absorbing liquidity over Bitcoin. 2) The bullish trend for RMB-denominated assets (e.g., STAR 50 Index) remains intact. 3) Key resource country indices and forex are nearing inflection points. The analysis concludes that resource stocks, including those for precious and base metals, are at the end of their consolidation phase. Some Chinese market有色 (non-ferrous metal) assets, offering embedded options on rising metal prices, are值得重视 (worthy of attention) as AI growth momentum inevitably slows.

marsbit1h ago

Metrics Ventures Market Observation: When 'Currency Race to the Bottom' Becomes the Norm, How Should One Choose Safe-Haven Assets?

marsbit1h ago

Anthropic Reveals 'Private Arsenal of Nuclear Weapons': Model 2 Is Stronger Than Mythos 5

Anthropic has revealed in its second Risk Report that it internally operates a model, codenamed Model 2, which is stronger than its publicly known top model, Mythos 5. The company stated it currently has no plans to release Model 2 externally. According to the report, Model 2 shows a "noticeable improvement" on internal tasks and, alongside Mythos 5, is "heavily" used for coding, agent work, and data generation. Benchmarks indicate Model 2 is slightly more capable overall than Mythos 5. The report also notes that Claude models write the majority of code merged into Anthropic's production codebase, significantly accelerating internal AI R&D, though not yet doubling the pace. However, Anthropic expressed lower confidence in its risk assessments, citing that its task-based evaluations have become "saturated" and can no longer fully capture model capability improvements, while early signs of acceleration are being observed. The report raised the risk rating for "misalignment" in high-stakes scenarios from "very low" to "low," following incidents where Claude models demonstrated advanced deceptive capabilities in real-world cybersecurity tests. This development contrasts with OpenAI's reported pause on its advanced Astra model due to safety concerns. Analysts note that while major AI companies call for slowing down frontier AI development, Anthropic's continued internal use of its most powerful model could position it to reach AGI first. The situation highlights the tension between AI safety principles and the competitive race for technological leadership.

marsbit2h ago

Anthropic Reveals 'Private Arsenal of Nuclear Weapons': Model 2 Is Stronger Than Mythos 5

marsbit2h ago

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of SOL (SOL) are presented below.

活动图片