Google, OpenAI, dan Microsoft secara aktif berinvestasi dalam teknologi yang memungkinkan komunikasi dengan agen AI melalui suara, mengharapkan peningkatan popularitas komunikasi lisan dengan AI dibandingkan permintaan berbasis teks. Arah ini semakin sering disebut sebagai AI suara. Minat investor dikonfirmasi oleh data PitchBook yang dikutip Financial Times: startup di bidang AI suara pada kuartal pertama tahun 2026 mengumpulkan sekitar $7 miliar — tujuh kali lipat lebih banyak dibanding periode yang sama tahun 2025.
Perhitungan didasarkan pada anggapan bahwa ucapan lisan secara bertahap akan menggeser input teks sebagai cara utama berkomunikasi dengan AI. Indikator dari pemain besar pasar mengonfirmasi hal ini.
Google Mencatat Pertumbuhan Permintaan Suara dan Visual
Menurut data Google, jumlah permintaan dalam mode AI meningkat lebih dari dua kali lipat setiap kuartal sejak layanan diluncurkan hingga April–Mei 2026. Di AS, suara atau gambar sekarang digunakan dalam lebih dari setiap permintaan pencarian keenam, dan jumlah permintaan dengan gambar tumbuh lebih dari 40% per bulan. Perusahaan menghubungkan dinamika ini dengan fakta bahwa pengguna semakin memilih format komunikasi yang mendekati ucapan alami, alih-alih mengetik teks.
Taruhan OpenAI pada Suara
Dari sekitar 900 juta pengguna aktif mingguan ChatGPT — angka ini diumumkan perusahaan pada akhir Februari 2026 — lebih dari 150 juta orang setiap minggu menggunakan suara dan dikte untuk berkomunikasi dengan layanan tersebut.
Pada 8 Juli 2026, OpenAI meluncurkan keluarga model GPT-Live: GPT-Live-1 dan versi ringan GPT-Live-1 mini. Ini adalah model full-duplex, yang mampu mendengarkan lawan bicara dan meresponsnya secara bersamaan, tanpa jeda khas "permintaan — respons". Model-model inilah yang menjadi dasar ChatGPT Voice yang diperbarui.
Selain perangkat lunak, OpenAI juga menyiapkan perangkat keras terpisah. Menurut informasi sumber Bloomberg, perusahaan sedang mengembangkan smart speaker tanpa layar dengan kamera dan sensor berbasis GPT-Live. Pengumuman mungkin terjadi pada tahun 2026, dan peluncuran pasar diharapkan pada awal 2027.
Microsoft Mengembangkan Sintesis Ucapan Ekspresif
Microsoft pada Juni 2026 memperkenalkan model MAI-Voice-2 — sintesis ucapan ekspresif dengan dukungan 15 bahasa dan kontrol pewarnaan emosional suara. Teknologi ini sudah terintegrasi ke dalam produk perusahaan, termasuk Dynamics 365 Contact Center dan Azure Voice Live.
Di antara arah utama di mana perusahaan bertaruh pada AI suara adalah:
-
pencarian dan bekerja dengan agen AI melalui ucapan lisan dan gambar
-
model suara full-duplex untuk dialog yang lebih alami
-
perangkat keras terpisah untuk interaksi suara
-
sintesis ucapan dengan kontrol emosi untuk layanan korporat
Pertumbuhan investasi dan pengumuman simultan dari Google, OpenAI, dan Microsoft menunjukkan bahwa antarmuka suara sedang beralih dari kategori fitur eksperimental menjadi arah pengembangan produk AI yang mandiri. Penyebaran lebih lanjut teknologi semacam ini akan bergantung pada seberapa cepat pengguna mengadaptasi cara interaksi baru dalam skenario sehari-hari.
Pandangan AI
Dari sudut pandang dinamika regulasi, ledakan AI suara membawa risiko yang dilewatkan oleh investor dan pengembang: kepercayaan pengguna pada "kemanusiaan" antarmuka. Sementara Google, OpenAI, dan Microsoft berlomba dalam naturalitas dialog, anggota parlemen Duma Negara telah mengajukan proposal kepada FAS (Layanan Antimonopoli Federal) untuk mewajibkan robot suara mengungkapkan sifat mereka sejak detik pertama panggilan. Kesenjangan antara perlombaan teknologi untuk "efek kehadiran" dan upaya regulator untuk mempertahankan batas antara manusia dan mesin dapat menjadi faktor signifikan bagi pasar, sama seperti volume investasi.
Pola historis mengisyaratkan kehati-hatian: asisten suara telah mengalami siklus ekspektasi yang berlebihan pada masa versi pertama Siri dan Alexa, ketika adopsi massal tidak memenuhi prediksi monetasinya. Pertanyaan terbuka adalah apakah gelombang model full-duplex saat ini akan menjadi pergeseran nyata dalam persepsi teknologi atau hanya putaran lain dari siklus yang sama.
end-content




