Google, OpenAI và Microsoft đang tích cực đầu tư vào công nghệ cho phép giao tiếp với đại lý AI bằng giọng nói, kỳ vọng vào sự phổ biến ngày càng tăng của giao tiếp bằng lời nói với AI so với các truy vấn văn bản. Lĩnh vực này ngày càng được gọi là AI giọng nói. Sự quan tâm của các nhà đầu tư được xác nhận bởi dữ liệu từ PitchBook mà Financial Times trích dẫn: các công ty khởi nghiệp trong lĩnh vực AI giọng nói đã huy động được khoảng 7 tỷ USD trong quý đầu tiên của năm 2026 - gấp bảy lần so với cùng kỳ năm 2025.
Các công ty đặt cược vào việc lời nói dần dần sẽ thay thế việc nhập văn bản như là phương thức giao tiếp chính với AI. Các chỉ số từ những công ty lớn trên thị trường xác nhận điều này.
Google ghi nhận sự gia tăng các truy vấn bằng giọng nói và hình ảnh
Theo dữ liệu của Google, số lượng truy vấn ở chế độ AI Mode đã tăng hơn gấp đôi mỗi quý kể từ khi dịch vụ ra mắt cho đến tháng 4–5 năm 2026. Tại Mỹ, giọng nói hoặc hình ảnh hiện được sử dụng trong hơn một phần sáu truy vấn tìm kiếm, và số lượng yêu cầu với hình ảnh đang tăng hơn 40% mỗi tháng. Công ty liên kết xu hướng này với việc người dùng ngày càng chọn định dạng giao tiếp gần với lời nói tự nhiên thay vì nhập văn bản.
Sự đặt cược của OpenAI vào giọng nói
Trong số khoảng 900 triệu người dùng hoạt động hàng tuần của ChatGPT - con số mà công ty công bố vào cuối tháng 2 năm 2026 - hơn 150 triệu người sử dụng giọng nói và tính năng đọc chính tả để giao tiếp với dịch vụ mỗi tuần.
Ngày 8 tháng 7 năm 2026, OpenAI đã ra mắt dòng mô hình GPT-Live: GPT-Live-1 và phiên bản nhẹ GPT-Live-1 mini. Đây là các mô hình full-duplex, có khả năng vừa lắng nghe người đối thoại vừa trả lời họ, mà không có khoảng dừng quen thuộc "yêu cầu - phản hồi". Chính những mô hình này đã tạo nền tảng cho ChatGPT Voice được cập nhật.
Bên cạnh phần mềm, OpenAI cũng đang chuẩn bị một thiết bị riêng biệt. Theo thông tin từ các nguồn của Bloomberg, công ty đang phát triển một loa thông minh không màn hình với camera và cảm biến dựa trên nền tảng GPT-Live. Sự kiện ra mắt có thể diễn ra ngay trong năm 2026, và việc tung ra thị trường được kỳ vọng vào đầu năm 2027.
Microsoft phát triển tổng hợp giọng nói biểu cảm
Microsoft vào tháng 6 năm 2026 đã giới thiệu mô hình MAI-Voice-2 - một bộ tổng hợp giọng nói biểu cảm hỗ trợ 15 ngôn ngữ với khả năng kiểm soát sắc thái cảm xúc của giọng nói. Công nghệ này đã được tích hợp vào các sản phẩm của công ty, bao gồm Dynamics 365 Contact Center và Azure Voice Live.
Trong số các hướng đi chính mà các công ty đặt cược vào AI giọng nói:
-
Tìm kiếm và làm việc với các đại lý AI thông qua lời nói và hình ảnh
-
Các mô hình giọng nói full-duplex để có cuộc đối thoại tự nhiên hơn
-
Các thiết bị phần cứng riêng biệt cho tương tác bằng giọng nói
-
Tổng hợp giọng nói với kiểm soát cảm xúc cho các dịch vụ doanh nghiệp
Sự tăng trưởng của đầu tư và các thông báo đồng thời từ Google, OpenAI và Microsoft cho thấy rằng các giao diện giọng nói đang chuyển từ các tính năng thử nghiệm sang một hướng phát triển độc lập cho sản phẩm AI. Sự phổ biến hơn nữa của các công nghệ như vậy sẽ phụ thuộc vào việc người dùng thích ứng nhanh như thế nào với các cách tương tác mới trong các tình huống hàng ngày.
Ý kiến từ AI
Từ góc độ động thái quản lý, sự bùng nổ của AI giọng nói mang theo một rủi ro mà các nhà đầu tư và nhà phát triển đã bỏ qua: sự tin tưởng của người dùng vào tính "con người" của giao diện. Trong khi Google, OpenAI và Microsoft đang cạnh tranh về mức độ tự nhiên của cuộc đối thoại, các nghị sĩ Duma Quốc gia đã gửi đề xuất đến FAS yêu cầu bắt buộc các robot giọng nói phải tiết lộ bản chất của chúng từ những giây đầu tiên của cuộc gọi. Khoảng cách giữa cuộc chạy đua công nghệ nhằm đạt "hiệu ứng hiện diện" và nỗ lực của các cơ quan quản lý để duy trì ranh giới giữa con người và máy móc có thể trở thành yếu tố thị trường quan trọng không kém so với khối lượng đầu tư.
Khuôn mẫu lịch sử gợi ý sự thận trọng: các trợ lý giọng nói đã từng trải qua chu kỳ kỳ vọng thái quá vào thời kỳ đầu của Siri và Alexa, khi việc triển khai hàng loạt không đáp ứng được dự báo về khả năng tạo doanh thu. Câu hỏi vẫn còn bỏ ngỏ là liệu làn sóng các mô hình full-duplex hiện tại có phải là một sự thay đổi thực sự trong nhận thức về công nghệ hay chỉ là một vòng xoáy mới của cùng một chu kỳ.
end-content




