Google, OpenAI và Microsoft đang tích cực đầu tư vào các công nghệ cho phép giao tiếp với các tác nhân AI bằng giọng nói, kỳ vọng vào sự phổ biến ngày càng tăng của giao tiếp bằng lời nói với AI so với các truy vấn văn bản. Lĩnh vực này ngày càng được gọi là AI giọng nói. Sự quan tâm của các nhà đầu tư được xác nhận bởi dữ liệu từ PitchBook mà Financial Times trích dẫn: các công ty khởi nghiệp trong lĩnh vực AI giọng nói đã huy động được khoảng 7 tỷ USD trong quý đầu tiên năm 2026 - gấp bảy lần so với cùng kỳ năm 2025.
Kỳ vọng được đặt ra rằng lời nói sẽ dần thay thế việc nhập văn bản như cách thức chính để giao tiếp với AI. Các chỉ số từ những công ty lớn trên thị trường xác nhận điều này.
Google ghi nhận sự gia tăng các truy vấn bằng giọng nói và hình ảnh
Theo số liệu từ Google, số lượng truy vấn ở chế độ AI Mode đã tăng hơn gấp đôi mỗi quý kể từ khi dịch vụ ra mắt cho đến tháng 4-5/2026. Tại Mỹ, giọng nói hoặc hình ảnh hiện được sử dụng trong hơn một trên sáu truy vấn tìm kiếm, và số lượng yêu cầu với hình ảnh đang tăng hơn 40% mỗi tháng. Công ty liên hệ xu hướng này với việc người dùng ngày càng lựa chọn định dạng giao tiếp gần với lời nói tự nhiên thay vì nhập văn bản.
Cược của OpenAI vào giọng nói
Trong số khoảng 900 triệu người dùng hoạt động hàng tuần của ChatGPT - con số mà công ty công bố vào cuối tháng 2/2026 - hơn 150 triệu người mỗi tuần sử dụng giọng nói và tính năng đọc chính tả để giao tiếp với dịch vụ.
Vào ngày 8 tháng 7 năm 2026, OpenAI đã ra mắt dòng mô hình GPT-Live: GPT-Live-1 và phiên bản nhẹ hơn GPT-Live-1 mini. Đây là các mô hình full-duplex (song công), có khả năng vừa nghe vừa trả lời người đối thoại mà không cần khoảng tạm dừng "truy vấn - phản hồi" thông thường. Chính chúng đã tạo nền tảng cho ChatGPT Voice được cập nhật.
Bên cạnh phần mềm, OpenAI cũng đang chuẩn bị một thiết bị riêng biệt. Theo thông tin từ các nguồn tin của Bloomberg, công ty đang phát triển một loa thông minh không màn hình có camera và cảm biến dựa trên GPT-Live. Thông báo có thể diễn ra trong năm 2026, và việc ra mắt thị trường được dự kiến vào đầu năm 2027.
Microsoft phát triển tổng hợp giọng nói biểu cảm
Vào tháng 6 năm 2026, Microsoft đã giới thiệu mô hình MAI-Voice-2 - một trình tổng hợp giọng nói biểu cảm hỗ trợ 15 ngôn ngữ và cho phép kiểm soát sắc thái cảm xúc của giọng nói. Công nghệ này đã được tích hợp vào các sản phẩm của công ty, bao gồm Dynamics 365 Contact Center và Azure Voice Live.
Các hướng phát triển chính mà các công ty đặt cược vào AI giọng nói bao gồm:
-
tìm kiếm và làm việc với các tác nhân AI thông qua lời nói và hình ảnh
-
mô hình giọng nói song công (full-duplex) cho cuộc đối thoại tự nhiên hơn
-
các thiết bị phần cứng riêng biệt cho tương tác bằng giọng nói
-
tổng hợp giọng nói với khả năng kiểm soát cảm xúc cho các dịch vụ doanh nghiệp
Sự gia tăng đầu tư và hàng loạt thông báo đồng thời từ Google, OpenAI và Microsoft cho thấy rằng các giao diện giọng nói đang chuyển từ chức năng thử nghiệm sang một hướng phát triển độc lập cho các sản phẩm AI. Sự phổ biến rộng rãi hơn của những công nghệ này sẽ phụ thuộc vào tốc độ người dùng thích ứng với các cách tương tác mới trong các kịch bản hàng ngày.
Quan điểm từ AI
Về mặt động thái quy định, cơn sốt AI giọng nói mang theo một rủi ro mà các nhà đầu tư và nhà phát triển đã bỏ qua: sự tin tưởng của người dùng vào tính "giống con người" của giao diện. Trong khi Google, OpenAI và Microsoft cạnh tranh về sự tự nhiên của cuộc đối thoại, các đại biểu Duma Quốc gia đã gửi đến Cơ quan Chống độc quyền Liên bang (FAS) đề xuất bắt buộc robot bằng giọng nói phải tiết lộ bản chất của mình ngay từ giây đầu tiên của cuộc gọi. Khoảng cách giữa cuộc đua công nghệ nhằm đạt được "hiệu ứng hiện diện" và nỗ lực của các cơ quan quản lý nhằm duy trì ranh giới giữa con người và máy móc có thể trở thành yếu tố quan trọng trên thị trường không kém gì quy mô đầu tư.
Khuôn mẫu lịch sử gợi ý sự thận trọng: các trợ lý giọng nói đã trải qua chu kỳ kỳ vọng quá cao vào thời các phiên bản đầu tiên của Siri và Alexa, khi việc triển khai hàng loạt không đáp ứng được các dự báo về khả năng sinh lời. Câu hỏi mở vẫn là: liệu làn sóng hiện tại của các mô hình full-duplex sẽ tạo ra sự thay đổi thực sự trong nhận thức về công nghệ hay chỉ là một vòng xoáy mới của cùng một chu kỳ.
end-content




