Microsoft Membuka Sumber AI Suara Terdepan VibeVoice: Proses 90 Menit Percakapan Multi-Pembicara Sekaligus, GitHub Raih 27K Star dengan Cepat

marsbitDipublikasikan tanggal 2026-03-30Terakhir diperbarui pada 2026-03-30

Abstrak

Microsoft baru-baru ini merilis model AI suara canggih VibeVoice sebagai proyek open-source, mencakup kemampuan ASR (Automatic Speech Recognition) dan TTS (Text-to-Speech). Model ini mampu memproses audio panjang (hingga 90 menit) dan percakapan multi-pembicara dengan latensi rendah. Proyek ini cepat populer di GitHub, mencapai sekitar 27K Star. VibeVoice-ASR-7B dapat memproses file audio hingga 60 menit, menghasilkan transkrip terstruktur dengan identifikasi pembicara, stempel waktu, dan dukungan untuk lebih dari 50 bahasa. VibeVoice-TTS-1.5B berfokus pada generasi suara ekspresif untuk percakapan alami hingga 4 pembicara dalam satu sesi. Sementara VibeVoice-Realtime-0.5B dirancang untuk skenario real-time dengan latency sekitar 300ms. Proyek ini menggunakan lisensi MIT, mendukung deploy lokal tanpa biaya langganan cloud, dan telah menerapkan mekanisme keamanan seperti watermark audio. Tersedia di GitHub dan Hugging Face untuk eksplorasi lebih lanjut.

Microsoft baru-baru ini membuka sumber model AI suara terdepan bernama VibeVoice, yang mencakup kemampuan seperti pengenalan suara otomatis (ASR) dan konversi teks ke suara (TTS). Proyek ini dengan cepat menarik perhatian komunitas pengembang berkat kemampuannya yang kuat dalam pemrosesan audio panjang, generasi percakapan alami multi-pembicara, serta karakteristik latensi rendah real-time, dan telah mengumpulkan sekitar 27K Star di GitHub.

Sebagai kerangka penelitian sumber terbuka, VibeVoice menggunakan lisensi MIT, mendukung penyebaran lokal, tidak memerlukan biaya langganan cloud, dan bertujuan untuk mendorong kolaborasi dan inovasi dalam bidang sintesis suara. Keluarga model terutama terdiri dari tiga anggota inti, masing-masing memiliki fokus berbeda, bersama-sama mengatasi kelemahan tradisional AI suara dalam pemrosesan urutan panjang, konsistensi pembicara, dan kelancaran alami.

VibeVoice-ASR-7B: Alat Transkripsi Suara ke Teks Terstruktur hingga 60 Menit

VibeVoice-ASR-7B adalah model terpadu untuk mengubah suara menjadi teks, mampu memproses file audio hingga 60 menit sekaligus dan langsung menghasilkan hasil transkripsi terstruktur. Keluaran tidak hanya mencakup "siapa yang berbicara" (pengenalan pembicara), "kapan berbicara" (stempel waktu yang tepat), tetapi juga "apa yang dikatakan" (konten detail), dan mendukung fungsi kata kunci khusus yang dapat secara efektif meningkatkan akurasi pengenalan untuk istilah proper atau teknis. Model ini mendukung lebih dari 50 bahasa, cocok untuk skenario kompleks seperti pencatatan rapat panjang atau transkrip podcast.

Pengembang komunitas telah mengembangkan alat praktis berdasarkan model ini, misalnya metode input suara bernama Vibing yang mendukung platform macOS dan Windows. Umpan balik pengguna menunjukkan bahwa kecepatan dan akurasi pengenalannya cukup baik, dapat secara signifikan meningkatkan efisiensi input suara sehari-hari.

VibeVoice-TTS-1.5B: Generasi Suara Ekspresif Multi-Pembicara 90 Menit

VibeVoice-TTS-1.5B adalah model inti yang berfokus pada konversi teks ke suara, mampu menghasilkan audio kontinu hingga 90 menit dalam satu kali generasi, mendukung hingga 4 pembicara berbeda untuk simulasi percakapan alami. Suara yang dihasilkan model sangat ekspresif, terdengar alami dan lancar, dapat meniru jeda, penekanan, dan perubahan emosi yang nyata, sangat cocok untuk produksi podcast, narasi audio panjang, buku audio, atau konten percakapan multi-karakter.

Dibandingkan dengan banyak model TTS tradisional yang hanya mendukung 1-2 pembicara, VibeVoice-TTS telah mencapai terobosan signifikan dalam konsistensi bentuk panjang dan multi-pembicara. Di balik layar, model ini menggunakan tokenizer suara kontinu (tokenizer akustik dan semantik) yang dikombinasikan dengan desain frame rate rendah (7.5Hz), secara signifikan meningkatkan efisiensi komputasi untuk pemrosesan urutan panjang.

VibeVoice-Realtime-0.5B: TTS Real-Time dengan Latensi Sekitar 300 Milidetik

VibeVoice-Realtime-0.5B berfokus pada skenario real-time, mendukung input teks streaming, dengan latensi keluaran audio pertama sekitar 300 milidetik, sekaligus masih dapat menghasilkan suara panjang sekitar 10 menit. Model ini sangat cocok untuk aplikasi interaktif yang memerlukan respons instan, seperti asisten suara real-time atau skenario sulih suara langsung.

Selain itu, proyek ini juga memperkenalkan dukungan pembicara eksperimental, termasuk suara multi-bahasa dan berbagai varian gaya bahasa Inggris, memberikan lebih banyak ruang kustomisasi bagi pengembang.

Komentar AIbase: Pembukaan sumber VibeVoice oleh Microsoft tidak hanya menurunkan ambang batas penggunaan AI suara berkinerja tinggi, tetapi juga menyediakan solusi lengkap untuk penyebaran lokal. Proyek ini pernah diturunkan sebentar karena risiko penyalahgunaan potensial, kemudian diluncurkan kembali dengan mekanisme keamanan seperti penyematan watermark audio dan pernyataan免责 (penafian pendengaran), mencerminkan prinsip pengembangan AI yang bertanggung jawab. Saat ini, pengembang dapat memperoleh bobot model di repositori GitHub dan Hugging Face, serta mencobanya dengan cepat melalui platform seperti Colab.

Dengan kontribusi berkelanjutan dari komunitas sumber terbuka (seperti fork optimasi untuk Apple Silicon), VibeVoice diharapkan dapat mempercepat penerapannya di bidang-bidang seperti pembuatan konten, alat aksesibilitas, dan interaksi suara. Pengembang yang tertarik dapat mengunjungi halaman proyek resmi Microsoft untuk mengeksplorasi lebih lanjut.

Alamat proyek: https://github.com/microsoft/VibeVoice

Kripto yang Sedang Tren

Pertanyaan Terkait

QApa itu VibeVoice dan mengapa proyek ini mendapatkan perhatian besar di GitHub?

AVibeVoice adalah keluarga model AI suara canggih yang dikembangkan oleh Microsoft, mencakup kemampuan seperti pengenalan suara otomatis (ASR) dan teks-ke-suara (TTS). Proyek ini mendapat perhatian karena kemampuannya memproses audio panjang, menghasilkan percakapan alami multi-pembicara, serta karakteristik latensi rendah secara real-time, dan telah meraih sekitar 27K bintang di GitHub.

QApa keunggulan utama dari model VibeVoice-ASR-7B?

AVibeVoice-ASR-7B adalah model pengubah suara-ke-teks terpadu yang dapat memproses file audio hingga 60 menit sekaligus dan mengeluarkan hasil transkripsi terstruktur. Ini mencakup pengenalan pembicara, stempel waktu yang tepat, konten detail, mendukung lebih dari 50 bahasa, dan memiliki fitur kata kustom untuk meningkatkan akurasi pengenalan istilah khusus.

QBagaimana VibeVoice-TTS-1.5B mengatasi tantangan dalam generasi suara?

AVibeVoice-TTS-1.5B berfokus pada generasi teks-ke-suara yang dapat menghasilkan audio terus-menerus hingga 90 menit dalam satu kali generasi, mendukung hingga 4 pembicara berbeda untuk simulasi percakapan alami. Suara yang dihasilkan ekspresif dan alami, meniru jeda, penekanan, dan perubahan emosi yang nyata, dengan efisiensi komputasi tinggi berkat penggunaan continuous speech tokenizer dan desain frame rate rendah (7.5Hz).

QApa kegunaan khusus dari VibeVoice-Realtime-0.5B?

AVibeVoice-Realtime-0.5B dirancang untuk skenario real-time, mendukung input teks streaming dengan latency output audio pertama sekitar 300 milidetik, dan masih dapat menghasilkan suara panjang hingga 10 menit. Model ini sangat cocok untuk aplikasi interaktif yang membutuhkan respons instan, seperti asisten suara real-time atau skenario sulih suara langsung.

QBagaimana Microsoft memastikan Pengembangan AI yang Bertanggung Jawab dalam proyek VibeVoice?

AMicrosoft telah menerapkan mekanisme keamanan seperti penyematan watermark audio dan pernyataan tanggung jawab yang dapat didengar untuk memastikan penggunaan yang bertanggung jawab. Proyek ini sempat diturunkan sementara karena risiko penyalahgunaan potensial, tetapi kemudian diunggah kembali dengan penambahan fitur-fitur keamanan ini, mencerminkan prinsip pengembangan AI yang bertanggung jawab.

Bacaan Terkait

Web3 yang Dulu Begitu Populer, Kini Masuki Gelombang PHK

Web3 yang pernah panas memasuki gelombang PHK besar-besaran. Di tengah klaim bahwa AI adalah alasan utama pengurangan tenaga kerja, banyak perusahaan sebenarnya menghadapi tekanan finansial. Industri Web3, sebagai persimpangan teknologi dan keuangan, terkena dampak parah. PHK terjadi dengan cepat dan tanpa peringatan. Banyak karyawan menerima notifikasi tiba-tiba, akses sistem langsung diputus, dan komunikasi terputus. Kompensasi sering kali tidak memadai, dengan perusahaan menggunakan alasan seperti "kinerja buruk" atau mengarahkan karyawan untuk memilih "mengundurkan diri secara sukarela" guna menghindari pembayaran kompensasi. Tempat kerja menjadi sangat beracun. Budaya "rapat berdiri" yang ekstrem, jam kerja yang panjang tanpa batas, pengawasan ketat, dan tekanan konstan merusak moral. Perebutan kekuasaan di antara manajemen menciptakan ketidakstabilan, di mana karyawan menjadi korban. Mereka yang bukan bagian dari "kelompok dalam" sering dikucilkan atau dialihkan ke posisi pinggiran sebelum akhirnya dipecat. Model bisnis inti Web3 — biaya perdagangan dan pencatatan koin — sedang runtuh. Biaya pencatatan yang tinggi membunuh inovasi, kualitas proyek menurun, dan investor ritel menjauh. Peristiwa likuidasi besar-besaran pada Oktober lalu semakin menguras kepercayaan. Peningkatan platform derivatif on-chain juga memberikan tekanan pada pertukaran terpusat. Banyak pekerja yang di-PHK beralih ke industri AI, yang dilihat lebih cerah. Namun, mereka yang tetap di Web3 menghadapi diskriminasi dari industri tradisional, yang memandang rendah latar belakang kripto. Sementara itu, di dalam industri, persaingan tidak sehat seperti saling merebut karyawan dan perang gosip terus berlanjut, menguras energi dalam pasar yang menyusut. Musim dingin ini berbeda. Bukan hanya siklus biasa, tetapi akibat dari model bisnis yang tidak berkelanjutan, praktik buruk, dan hilangnya kepercayaan. Pertanyaannya tetap: kemunduran industri Web3 ini adalah kesalahan siapa?

marsbit5m yang lalu

Web3 yang Dulu Begitu Populer, Kini Masuki Gelombang PHK

marsbit5m yang lalu

Penjualan Turun 26% Malah Naik Harga? Dilema Xiaomi

Industri ponsel menghadapi ujian berat dengan melonjaknya biaya komponen inti, khususnya chip penyimpanan. Pada 2 Agustus, Xiaomi melakukan penyesuaian harga ketiga kalinya tahun ini, menaikkan harga 9 model termasuk seri Xiaomi 17, REDMI K90, dan Turbo 5. Kenaikan mencapai 400-500 yuan untuk lini flagship, dengan Xiaomi 17 Pro Max kini mulai dari 6.499 yuan. Penyesuaian ini menyusul kenaikan bertahap sejak Maret, mencerminkan tekanan biaya yang merambat dari model entry-level hingga flagship. Lonjakan biaya terutama didorong oleh naiknya harga chip memori (DRAM dan NAND). Permintaan tinggi untuk HBM (High Bandwidth Memory) untuk AI telah mengalihkan kapasitas produksi, memangkas pasokan untuk perangkat konsumen. Presiden Grup Xiaomi, Lu Weibing, mengungkapkan harga memori untuk versi yang sama telah melonjak hampir 4 kali lipat dibandingkan kuartal pertama 2025, menambah biaya sekitar 1.500 yuan per unit untuk konfigurasi 12GB+512GB. Tren kenaikan diperkirakan berlanjut hingga akhir 2027 atau 2028. Sementara itu, Xiaomi juga mengalami tekanan penjualan. Data IDC kuartal II 2026 menunjukkan pengiriman ponsel global Xiaomi turun 26,3% year-on-year menjadi 31,2 juta unit, meski tetap menjadi produsen China teratas peringkat ketiga dunia. Di pasar domestik China, pangsa Xiaomi turun ke posisi kelima dengan penurunan 21%, di bawah Huawei, Apple, OPPO, dan vivo. Penurunan ini disebabkan kombinasi harga yang lebih tinggi yang menekan permintaan dan strategi Xiaomi mengurangi proporsi model entry-level untuk meningkatkan struktur produk. Untuk menghadapi tantangan ganda ini, Xiaomi berupaya mengurangi ketergantungan melalui penguatan chip in-house (seri Surge) dan mengoptimalkan konfigurasi serta proporsi model penyimpanan (SKU) di berbagai segmen harga. Xiaomi bukan satu-satunya. Sejak Maret, merek seperti OPPO, vivo, dan Honor juga telah menaikkan harga, dengan Apple menaikkan harga iPad dan MacBook pada Juni. Industri memprediksi gelombang penyesuaian harga kedua akan terjadi pada paruh kedua tahun ini. Siklus kenaikan harga industri yang luas telah dimulai, memaksa perusahaan dan konsumen untuk menyesuaikan strategi.

marsbit19m yang lalu

Penjualan Turun 26% Malah Naik Harga? Dilema Xiaomi

marsbit19m yang lalu

7 Bulan, 23 Perusahaan Baru Dibentuk, "Model Dunia" Masuk Tahap "Produksi Massal"

Dalam tujuh bulan pertama tahun 2026, dunia startup AI Tiongkok menyaksikan fenomena signifikan: 23 perusahaan baru yang berfokus pada "World Model" atau Model Dunia telah didirikan, melampaui total 20 perusahaan pada tahun 2025. Dari jumlah tersebut, 18 perusahaan berhasil meraih pendanaan tahap awal hanya dalam beberapa bulan setelah berdiri, dengan dua di antaranya langsung mencapai status unicorn dan empat masuk klub "Qianlima" IT桔子 (valuasi di atas 1 miliar RMB). Artikel ini mengelompokkan 23 perusahaan tersebut ke dalam lima jalur teknis utama: 1. **Pondasi Model Dunia Umum**: Bertujuan membangun sistem dasar pemahaman dunia fisik yang luas, seperti *Yuyong Technology* (didirikan mantan kepala Qwen Alibaba) dan *Nijuzhen Technology/Physis* (dibesut mahasiswa 22 tahun dari Peking University). 2. **Kecerdasan 4D & Spasial**: Fokus pada pemodelan kembaran digital dunia dengan dimensi waktu dan kedalaman, contohnya *Yuanhao Power*. 3. **Penalaran Kausal**: Menekankan pemahaman "sebab-akibat" di balik fenomena fisik, seperti *Aether AI*. 4. **Kecerdasan Berwujud (Embodied AI)**: Menggunakan Model Dunia sebagai "otak" untuk robot, dengan contoh seperti *PokeBot* (robot mampu memasak autonom) dan *Kunlun Xing Robot*. 5. **Aplikasi Skenario Vertikal**: Menerapkan Model Dunia di bidang khusus seperti logistik (*Quantum Power*), penemuan ilmiah, dan simulasi molekul. Beberapa tren kunci teramati: pendanaan besar terjadi sangat awal (bahkan di tahap seed), latar belakang pendiri sangat beragam (dari bintang akademik, eksekutif puncak perusahaan besar, hingga wirausahawan serial), terjalinnya kedalaman koneksi akademik-industri, dan aliran talenta dari perusahaan besar ke startup. Modal dari industri robotik (seperti Zhiyuan Robot) juga aktif berinvestasi untuk membangun ekosistem. Meski Beijing tetap menjadi pusat, terjadi penyebaran ke kota-kota seperti Hangzhou dan Shenzhen. Data ini menandakan bahwa Model Dunia telah bergerak dari fase konseptual ke fase praktik rekayasa dan kompetisi nyata di Tiongkok.

marsbit23m yang lalu

7 Bulan, 23 Perusahaan Baru Dibentuk, "Model Dunia" Masuk Tahap "Produksi Massal"

marsbit23m yang lalu

Trading

Spot

Artikel Populer

Cara Membeli ONE

Selamat datang di HTX.com! Kami telah membuat pembelian Harmony (ONE) menjadi mudah dan nyaman. Ikuti panduan langkah demi langkah kami untuk memulai perjalanan kripto Anda.Langkah 1: Buat Akun HTX AndaGunakan alamat email atau nomor ponsel Anda untuk mendaftar akun gratis di HTX. Rasakan perjalanan pendaftaran yang mudah dan buka semua fitur.Dapatkan Akun SayaLangkah 2: Buka Beli Kripto, lalu Pilih Metode Pembayaran AndaKartu Kredit/Debit: Gunakan Visa atau Mastercard Anda untuk membeli Harmony (ONE) secara instan.Saldo: Gunakan dana dari saldo akun HTX Anda untuk melakukan trading dengan lancar.Pihak Ketiga: Kami telah menambahkan metode pembayaran populer seperti Google Pay dan Apple Pay untuk meningkatkan kenyamanan.P2P: Lakukan trading langsung dengan pengguna lain di HTX.Over-the-Counter (OTC): Kami menawarkan layanan yang dibuat khusus dan kurs yang kompetitif bagi para trader.Langkah 3: Simpan Harmony (ONE) AndaSetelah melakukan pembelian, simpan Harmony (ONE) di akun HTX Anda. Selain itu, Anda dapat mengirimkannya ke tempat lain melalui transfer blockchain atau menggunakannya untuk memperdagangkan mata uang kripto lainnya.Langkah 4: Lakukan trading Harmony (ONE)Lakukan trading Harmony (ONE) dengan mudah di pasar spot HTX. Cukup akses akun Anda, pilih pasangan perdagangan, jalankan trading, lalu pantau secara real-time. Kami menawarkan pengalaman yang ramah pengguna baik untuk pemula maupun trader berpengalaman.

663 Total TayanganDipublikasikan pada 2024.12.12Diperbarui pada 2026.06.02

Cara Membeli ONE

Diskusi

Selamat datang di Komunitas HTX. Di sini, Anda bisa terus mendapatkan informasi terbaru tentang perkembangan platform terkini dan mendapatkan akses ke wawasan pasar profesional. Pendapat pengguna mengenai harga ONE (ONE) disajikan di bawah ini.

活动图片