Baru saja, Anthropic dan OpenAI secara bersamaan merilis pembaruan besar-besaran pada mode suara!
Di sisi Claude, dari yang sebelumnya hanya bisa menjalankan Haiku, kini ditingkatkan ke seri lengkap Opus 4.8 dan Sonnet 5. Tidak hanya dapat memanggil Gmail, Kalender, Slack dalam percakapan, tetapi juga diperluas ke 11 bahasa, namun tidak termasuk bahasa Mandarin.

Di sisi OpenAI, GPT-Live full-duplex langsung diluncurkan ke desktop macOS dan Windows, dengan perintah suara dapat mengendalikan sekaligus sejumlah Agent, dan mendukung bahasa Mandarin.

Pembaruan Besar Claude Voice
Sebelumnya, mode suara Claude hanya bisa menjalankan Haiku, yaitu model terkecil.
Saat Anda berbicara dengannya, ia bisa memahami, tetapi pertanyaan yang sedikit kompleks mudah bermasalah.
Sekarang, Opus 4.8 dan Sonnet 5 sudah tersedia.
Anda dapat mengganti model di tengah percakapan. Sistem secara otomatis memanggil versi tercepat dari model yang dipilih. Perhatikan, ini adalah versi tercepat, bukan versi reasoning penuh.

Kabar baiknya, mode suara akan secara default memuat model yang Anda gunakan terakhir kali dalam obrolan teks, konteks antara teks dan suara tidak terputus, dapat berpindah secara mulus.
Dalam hal interaksi, ada dua mode: Hands-free mendengarkan terus menerus dan membalas otomatis, Push-to-talk menekan untuk berbicara, lepas untuk berhenti.
Tentu saja, yang paling penting adalah kemampuan "Pemanggilan Alat".
Dalam percakapan suara, Claude sekarang dapat langsung terhubung ke Gmail, Google Calendar, Slack, Google Docs, Canva Anda.
Ucapkan satu kalimat, ia akan membuka email, memeriksa kalender, membaca dokumen, mengirim pesan untuk Anda.
Product Manager Anthropic, Robert Bye, memberikan beberapa contoh:
· Bantu saya merangkum apa yang saya lewatkan di Slack dalam beberapa jam terakhir.
· Kirim ringkasan PRD proyek baru kepada Nick di Slack.
Selesai berbicara, pekerjaan selesai.

Secara teknis, pemanggilan alat dalam suara menggunakan arsitektur Connectors yang sama dengan obrolan teks, bukan versi terbatas, dan akan meminta izin Anda sebelum setiap pemanggilan.
Semua paket bisa menggunakannya, tetapi pengguna gratis hanya mendapatkan Haiku ditambah 1 konektor, untuk akses penuh Opus perlu berlangganan. Penggunaan akan dipotong dari kuota reguler, mulai hari ini diluncurkan ke publik di semua platform.
11 Bahasa, Tanpa Bahasa Mandarin
Dalam hal bahasa, mode suara Claude kali ini mendukung 11 bahasa: Inggris, Prancis, Jerman, Hindi, Indonesia, Italia, Jepang, Korea, Portugis Brasil, Spanyol Amerika Latin, Spanyol Eropa.
Dicari dari awal sampai akhir, tidak ada bahasa Mandarin.
Bagi pengguna bahasa ini, tetap harus mengetik.

Dan Claude tidak dapat mendeteksi secara otomatis bahasa apa yang Anda gunakan.
Anda harus secara aktif memintanya untuk berganti, misalnya "Tolong bicaralah dalam bahasa Jepang", atau pilih manual di pengaturan. Jika tidak diganti, default-nya adalah bahasa Inggris.
Menariknya, sebelumnya ada pengembang yang menemukan daftar bahasa dari kode aplikasi Claude, yang berisi 18 bahasa, di mana jelas tertulis Chinese.
Namun, dari 18 menjadi 11, bahasa Mandarin langsung dihapus.

ChatGPT Voice Masuk ke Desktop
Sebaliknya, suara ChatGPT mengganti seluruh arsitektur baru dari dasarnya.
Ia menggunakan GPT-Live yang baru dirilis pada 8 Juli, sebuah model suara full-duplex.
Yang dimaksud full-duplex adalah, model mampu memproses input dan output aliran audio secara bersamaan, dan membuat puluhan keputusan per detik, tidak perlu menunggu Anda selesai berbicara untuk merespons.
Jadi GPT-Live akan berkata "hmm" "mengerti" di tengah-tengah Anda berbicara, seperti orang hidup yang sedang mendengarkan.
Lebih lanjut, ini didasarkan pada arsitektur dua lapis.
Di depan adalah model suara ringan dengan latensi rendah, bertanggung jawab untuk percakapan real-time, manajemen giliran, respons interupsi, semua hal yang memerlukan reaksi milidetik.
Di belakang adalah GPT-5.5, bertanggung jawab untuk reasoning kompleks, pencarian web, tugas-tugas Agent.
Saat Anda bertanya sesuatu yang memerlukan pemikiran mendalam, GPT-Live akan mendelegasikan tugas secara asinkron ke GPT-5.5 di belakang, sambil terus berbicara dengan Anda, dan melaporkan hasilnya ketika sudah siap.
OpenAI menyebut ini sebagai "Delegated Reasoning".

Secara konkret, OpenAI telah benar-benar memisahkan latensi percakapan dan kedalaman reasoning. Anda tidak perlu menunggu model besar selesai berpikir untuk dapat terus berbicara.
Kedalaman reasoning juga dapat disesuaikan dalam tiga tingkat: Instant tercepat, Medium reasoning sedang, High reasoning mendalam, masing-masing sesuai dengan tingkat yang berbeda dari GPT-5.5. Pengguna gratis menggunakan GPT-Live-1 mini.
Dari hasil benchmark, arsitektur delegasi ini benar-benar efektif, mode suara akhirnya bukan lagi "obrolan versi downgrade".
GPQA (reasoning ilmiah tingkat ahli) melonjak dari 45.3% di mode suara lanjutan sebelumnya menjadi 84.2%.
BrowseComp (kemampuan Agent untuk mencari di web) melonjak dari 0.7% menjadi 75.2%.
Pada benchmark τ3-Voice Telecom yang mensimulasikan skenario layanan pelanggan telekomunikasi multi-giliran yang realistis, GPT-Live juga secara komprehensif mengungguli.



Berbicara, Beberapa Agent Berjalan Bersamaan
Dengan dasar ini, OpenAI langsung membawanya ke desktop.
Mulai hari ini, ChatGPT Voice secara resmi hadir di desktop macOS dan Windows.
Anda dapat mengatur pintasan keyboard global, untuk membangkitkan ChatGPT Voice dengan satu tombol di aplikasi apa pun.
Di macOS, ada juga fungsi Appshots, ChatGPT dapat langsung membaca konten jendela aktif Anda saat ini, sebagai konteks percakapan.
Misalnya, saat mengatakan kepada Excel "bantu saya menghitung Q3 year-on-year", ia dapat melihat tabel Anda.

Selain itu, Anda juga dapat menggunakan suara untuk mengarahkan beberapa Agent di ChatGPT Work dan Codex untuk bekerja bersamaan.
Menyuruh satu Agent menulis kode, sementara Agent lain mencari dokumen, cukup dengan berbicara.
GPT-Live berbicara dengan Anda di depan, sambil secara bersamaan memulai, memeriksa, beralih di antara beberapa thread pekerjaan di belakang, tanpa perlu Anda kembali ke keyboard.
Saat ini, tersedia untuk paket Plus, Pro, Business, Edu, Enterprise.
Perbedaan yang Dapat Dirasakan dalam 10 Detik
Bisakah Diinterupsi
Suara Claude bergiliran, ia berpikir setelah Anda selesai. Ingin menyela? Tunggu.
GPT-Live dapat diinterupsi. Di tengah pembicaraan Anda berubah pikiran, ia langsung berhenti dan mengikuti ide baru Anda. Ingat di mana interupsi terjadi.
Bisakah Multitasking
Claude hanya melakukan satu hal dalam satu waktu – obrolan suara.
ChatGPT Voice di desktop dapat berbicara dengan Anda sambil mengendalikan komputer di belakang, mengarahkan beberapa Agent untuk melakukan tugas masing-masing.
"Buka PR untuk saya, sekaligus periksa log CI kemarin", dua hal dapat mulai dijalankan bersamaan.
Bisakah Melakukan Tindakan
Suara Claude dapat memanggil alat SaaS seperti Gmail, kalender melalui connector, tetapi tidak dapat menyentuh desktop Anda.
ChatGPT Voice di desktop, bersama dengan Computer Use, dapat langsung mengendalikan komputer Anda. File, program, terminal, semuanya dapat disentuhnya.
Seberapa Dalam Kemampuan Berpikir
Kartu truf Claude adalah Opus 4.8, yang masih menjadi salah satu model terkuat dalam tugas reasoning multi-langkah dan sintesis pengetahuan. Namun, mode suara menjalankan versi tercepat Opus, bukan versi reasoning penuh.
Di sisi GPT-Live, tingkat High dapat secara asinkron mendelegasikan ke GPT-5.5 Thinking untuk melakukan reasoning mendalam, justru dapat memanggil kemampuan reasoning mendekati penuh dalam skenario suara.

Era Tanpa Perlu Kotak Input
Melihat ke sini, perbedaan antara kedua perusahaan menjadi jelas.
Claude dengan sistem bergiliran, fokus pada penggunaan Gmail, kalender, dokumen Anda sendiri, membantu Anda mengelola urusan Anda.
GPT-Live full-duplex, fokus pada berbicara seperti dengan seorang manusia. Dapat diinterupsi, dapat multitasking, dapat mengendalikan komputer, membuat Anda lupa bahwa di seberang adalah AI.
Bagi yang tidak menulis kode, ambang batas Claude jauh lebih rendah, ada email yang perlu diatur, jadwal yang perlu diatur, cukup berbicara.
Jalur OpenAI lebih menyenangkan dan lebih geek, Anda harus benar-benar memiliki sejumlah Agent, memiliki pekerjaan nyata untuk mereka lakukan.
Seperti yang dikatakan Greg Brockman, "Dibandingkan dengan suara, mengetik itu sendiri sudah sangat tidak natural."
Tombol plastik yang menemani manusia selama empat puluh tahun, kini secara resmi didesak ke sudut oleh OpenAI dan Anthropic secara bersamaan.

Referensi:
https://x.com/testingcatalog/status/2080401533728940372
https://x.com/OpenAI/status/2080378182469857576
https://x.com/testingcatalog/status/2080385285951521150
https://x.com/claudeai/status/2080376094939603366
https://claude.com/blog/think-through-hard-problems-in-voice-mode
Artikel ini berasal dari akun WeChat "Xin Zhi Yuan", penulis: ASI Revelation, editor: Moses





