Từ văn bản đến giọng nói: Google, OpenAI và Microsoft đầu tư hàng tỷ USD vào giao tiếp bằng lời nói với AI

cryptonews.ruXuất bản vào 2026-08-07Cập nhật gần nhất vào 2026-08-07

Tóm tắt

Google, OpenAI và Microsoft đang đầu tư mạnh vào công nghệ cho phép giao tiếp với AI bằng giọng nói, dự đoán phương thức này sẽ vượt trội so với nhập văn bản. Các khoản đầu tư vào AI giọng nói đã tăng gấp 7 lần trong quý đầu năm 2026 so với cùng kỳ năm trước. Google báo cáo số lượt tìm kiếm bằng giọng nói và hình ảnh tăng hơn gấp đôi mỗi quý. Với ChatGPT, hơn 150 triệu người dùng sử dụng tính năng thoại mỗi tuần. OpenAI đã ra mắt mô hình GPT-Live hỗ trợ hội thoại song công (full-duplex) và đang phát triển một loa thông minh chuyên dụng. Microsoft giới thiệu bộ tổng hợp giọng nói MAI-Voice-2 có thể điều khiển sắc thái cảm xúc. Các trọng tâm phát triển chính bao gồm tương tác thoại tự nhiên, thiết bị phần cứng chuyên biệt và tổng hợp giọng nói biểu cảm. Mặc dù tiềm năng lớn, lĩnh vực này cũng đối mặt với thách thức về quy định (như yêu cầu AI phải tự nhận diện) và câu hỏi về việc liệu đây có phải là bước đột phá thực sự hay chỉ là một chu kỳ đầu tư cường điệu mới.

Google, OpenAI và Microsoft đang tích cực đầu tư vào công nghệ cho phép giao tiếp với đại lý AI bằng giọng nói, kỳ vọng vào sự phổ biến ngày càng tăng của giao tiếp bằng lời nói với AI so với các truy vấn văn bản. Lĩnh vực này ngày càng được gọi là AI giọng nói. Sự quan tâm của các nhà đầu tư được xác nhận bởi dữ liệu từ PitchBook mà Financial Times trích dẫn: các công ty khởi nghiệp trong lĩnh vực AI giọng nói đã huy động được khoảng 7 tỷ USD trong quý đầu tiên của năm 2026 - gấp bảy lần so với cùng kỳ năm 2025.

Các công ty đặt cược vào việc lời nói dần dần sẽ thay thế việc nhập văn bản như là phương thức giao tiếp chính với AI. Các chỉ số từ những công ty lớn trên thị trường xác nhận điều này.

Google ghi nhận sự gia tăng các truy vấn bằng giọng nói và hình ảnh

Theo dữ liệu của Google, số lượng truy vấn ở chế độ AI Mode đã tăng hơn gấp đôi mỗi quý kể từ khi dịch vụ ra mắt cho đến tháng 4–5 năm 2026. Tại Mỹ, giọng nói hoặc hình ảnh hiện được sử dụng trong hơn một phần sáu truy vấn tìm kiếm, và số lượng yêu cầu với hình ảnh đang tăng hơn 40% mỗi tháng. Công ty liên kết xu hướng này với việc người dùng ngày càng chọn định dạng giao tiếp gần với lời nói tự nhiên thay vì nhập văn bản.

Sự đặt cược của OpenAI vào giọng nói

Trong số khoảng 900 triệu người dùng hoạt động hàng tuần của ChatGPT - con số mà công ty công bố vào cuối tháng 2 năm 2026 - hơn 150 triệu người sử dụng giọng nói và tính năng đọc chính tả để giao tiếp với dịch vụ mỗi tuần.

Ngày 8 tháng 7 năm 2026, OpenAI đã ra mắt dòng mô hình GPT-Live: GPT-Live-1 và phiên bản nhẹ GPT-Live-1 mini. Đây là các mô hình full-duplex, có khả năng vừa lắng nghe người đối thoại vừa trả lời họ, mà không có khoảng dừng quen thuộc "yêu cầu - phản hồi". Chính những mô hình này đã tạo nền tảng cho ChatGPT Voice được cập nhật.

Bên cạnh phần mềm, OpenAI cũng đang chuẩn bị một thiết bị riêng biệt. Theo thông tin từ các nguồn của Bloomberg, công ty đang phát triển một loa thông minh không màn hình với camera và cảm biến dựa trên nền tảng GPT-Live. Sự kiện ra mắt có thể diễn ra ngay trong năm 2026, và việc tung ra thị trường được kỳ vọng vào đầu năm 2027.

Microsoft phát triển tổng hợp giọng nói biểu cảm

Microsoft vào tháng 6 năm 2026 đã giới thiệu mô hình MAI-Voice-2 - một bộ tổng hợp giọng nói biểu cảm hỗ trợ 15 ngôn ngữ với khả năng kiểm soát sắc thái cảm xúc của giọng nói. Công nghệ này đã được tích hợp vào các sản phẩm của công ty, bao gồm Dynamics 365 Contact Center và Azure Voice Live.

Trong số các hướng đi chính mà các công ty đặt cược vào AI giọng nói:

  • Tìm kiếm và làm việc với các đại lý AI thông qua lời nói và hình ảnh

  • Các mô hình giọng nói full-duplex để có cuộc đối thoại tự nhiên hơn

  • Các thiết bị phần cứng riêng biệt cho tương tác bằng giọng nói

  • Tổng hợp giọng nói với kiểm soát cảm xúc cho các dịch vụ doanh nghiệp

Sự tăng trưởng của đầu tư và các thông báo đồng thời từ Google, OpenAI và Microsoft cho thấy rằng các giao diện giọng nói đang chuyển từ các tính năng thử nghiệm sang một hướng phát triển độc lập cho sản phẩm AI. Sự phổ biến hơn nữa của các công nghệ như vậy sẽ phụ thuộc vào việc người dùng thích ứng nhanh như thế nào với các cách tương tác mới trong các tình huống hàng ngày.

Ý kiến từ AI

Từ góc độ động thái quản lý, sự bùng nổ của AI giọng nói mang theo một rủi ro mà các nhà đầu tư và nhà phát triển đã bỏ qua: sự tin tưởng của người dùng vào tính "con người" của giao diện. Trong khi Google, OpenAI và Microsoft đang cạnh tranh về mức độ tự nhiên của cuộc đối thoại, các nghị sĩ Duma Quốc gia đã gửi đề xuất đến FAS yêu cầu bắt buộc các robot giọng nói phải tiết lộ bản chất của chúng từ những giây đầu tiên của cuộc gọi. Khoảng cách giữa cuộc chạy đua công nghệ nhằm đạt "hiệu ứng hiện diện" và nỗ lực của các cơ quan quản lý để duy trì ranh giới giữa con người và máy móc có thể trở thành yếu tố thị trường quan trọng không kém so với khối lượng đầu tư.

Khuôn mẫu lịch sử gợi ý sự thận trọng: các trợ lý giọng nói đã từng trải qua chu kỳ kỳ vọng thái quá vào thời kỳ đầu của Siri và Alexa, khi việc triển khai hàng loạt không đáp ứng được dự báo về khả năng tạo doanh thu. Câu hỏi vẫn còn bỏ ngỏ là liệu làn sóng các mô hình full-duplex hiện tại có phải là một sự thay đổi thực sự trong nhận thức về công nghệ hay chỉ là một vòng xoáy mới của cùng một chu kỳ.

end-content

Câu hỏi Liên quan

QTại sao các công ty công nghệ lớn như Google, OpenAI và Microsoft đang đầu tư mạnh vào trí tuệ nhân tạo giọng nói?

AHọ đầu tư mạnh vì kỳ vọng giao tiếp bằng giọng nói với AI sẽ trở nên phổ biến hơn so với các truy vấn văn bản. Số liệu đầu tư vào các startup AI giọng nói tăng gấp 7 lần trong quý I năm 2026 so với cùng kỳ năm 2025 cho thấy sự quan tâm lớn từ các nhà đầu tư.

QSự tăng trưởng trong việc sử dụng AI Mode của Google được thể hiện như thế nào?

ASố lượng truy vấn ở chế độ AI Mode của Google đã tăng hơn gấp đôi mỗi quý kể từ khi ra mắt cho đến tháng 4–5/2026. Tại Mỹ, hơn 1/6 truy vấn tìm kiếm sử dụng giọng nói hoặc hình ảnh, với số lượng truy vấn bằng hình ảnh tăng hơn 40% mỗi tháng.

QOpenAI đã công bố những mô hình và sản phẩm phần cứng nào mới trong lĩnh vực AI giọng nói?

AOpenAI đã ra mắt bộ mô hình GPT-Live (GPT-Live-1 và GPT-Live-1 mini) vào ngày 8/7/2026. Đây là các mô hình full-duplex, cho phép nghe và trả lời đồng thời, tạo nền tảng cho ChatGPT Voice mới. Ngoài ra, công ty cũng đang phát triển một loa thông minh không màn hình (screenless smart speaker) với camera và cảm biến, dự kiến ra mắt thị trường đầu năm 2027.

QMicrosoft đóng góp gì vào sự phát triển của công nghệ tổng hợp giọng nói?

AVào tháng 6/2026, Microsoft đã giới thiệu mô hình MAI-Voice-2, một bộ tổng hợp giọng nói biểu cảm hỗ trợ 15 ngôn ngữ và cho phép kiểm soát sắc thái cảm xúc của giọng nói. Công nghệ này đang được tích hợp vào các sản phẩm như Dynamics 365 Contact Center và Azure Voice Live.

QBài viết nêu lên những rủi ro tiềm ẩn nào đối với sự bùng nổ của AI giọng nói?

ABài viết chỉ ra hai rủi ro chính: 1) Vấn đề niềm tin của người dùng và quy định. Khi các giao diện giọng nói trở nên quá giống con người, có thể cần quy định bắt buộc AI phải tiết lộ bản chất máy móc ngay từ đầu để duy trì ranh giới rõ ràng. 2) Lịch sử cho thấy các trợ lý ảo từng trải qua chu kỳ kỳ vọng quá cao (như Siri, Alexa ban đầu) và thất bại trong dự báo thương mại hóa, đặt ra câu hỏi liệu làn sóng AI giọng nói full-duplex hiện tại có thực sự tạo ra bước ngoặt hay chỉ là một chu kỳ mới.

Nội dung Liên quan

Bitcoiners chuyển sang dùng xúc xắc khi các thiết lập tự giữ tiền được đánh giá lại

Trước sự cố lỗi entropy thấp nghiêm trọng trên ví cứng Coldcard dẫn đến các vụ trộm tiền điện tử từ ngày 30/7, người dùng Bitcoin đang xem xét lại các giả định về độ tin cậy trong thiết lập tự giữ ví. Lỗi này, bắt đầu từ firmware 4.0.1 vào tháng 3/2021, khiến thiết bị sử dụng bộ tạo số giả ngẫu nhiên Yasmarang thay vì phần cứng RNG chuyên dụng, làm giảm đáng kể entropy (chỉ còn khoảng 40-70 bit so với mức 128 bit cần thiết), tạo điều kiện cho tin tặc bẻ khóa thành công khóa riêng tư và đánh cắp hơn 100 triệu USD Bitcoin. Sự cố này nhấn mạnh nguyên tắc "đừng tin tưởng, hãy xác minh". Những người dùng tạo cụm seed (khóa khôi phục) bằng phương pháp vật lý như gieo xúc xắc đã bảo vệ được tài sản của mình. Gieo xúc xắc (tối thiểu 100 lần cho seed 24 từ) là quy trình minh bạch, dễ kiểm tra, loại bỏ điểm yếu duy nhất trong việc tạo ví. Các phương pháp khác như sử dụng bảng tra giấy (ví dụ Bitbox), mẫu khử thiên vị codex32, hoặc rút ngẫu nhiên từ các mảnh giấy ghi từ BIP-39 cũng đang được cộng đồng chia sẻ rộng rãi để tạo entropy an toàn. Người dùng cũng có thể kiểm tra chéo tính toàn vẹn bằng cách nhập seed vào nhiều thiết bị để so sánh địa chỉ nhận hoặc chữ ký giao dịch.

cointelegraph5 phút trước

Bitcoiners chuyển sang dùng xúc xắc khi các thiết lập tự giữ tiền được đánh giá lại

cointelegraph5 phút trước

Sui tích hợp chữ ký kháng lượng tử

Blockchain lớp 1 Sui đã công bố triển khai hai sơ đồ chữ ký số hậu lượng tử như một phần của kế hoạch dài hạn nhằm nâng cao bảo mật mạng. Bản cập nhật nhằm bảo vệ tài khoản người dùng và hợp đồng thông minh khỏi các mối đe dọa tiềm tàng từ sự phát triển của máy tính lượng tử. Mạng sẽ sử dụng thuật toán ML-DSA-65 cho tài khoản người dùng thông thường và SLH-DSA-SHA2-128s cho các kho lưu trữ được quản lý bởi hợp đồng thông minh. Cả hai thuật toán đều dựa trên các tiêu chuẩn mật mã hậu lượng tử đã được Viện Tiêu chuẩn và Công nghệ Quốc gia Hoa Kỳ phê duyệt. Việc áp dụng hai sơ đồ chữ ký khác nhau giúp giảm thiểu rủi ro. Phần lớn việc triển khai đã hoàn thành và được kiểm tra. Kho lưu trữ kháng lượng tử dự kiến sẽ được thêm vào mạng chính trước cuối năm nay, trong khi hỗ trợ tài khoản với ML-DSA-65 sẽ có trên mạng thử nghiệm trước cuối năm 2026. Việc triển khai đầy đủ cho tài khoản trên mạng chính được lên kế hoạch cho quý đầu tiên năm 2027. Các bản cập nhật cần thiết cho ví, SDK và CLI cũng sẽ được phát hành, và các đánh giá bảo mật độc lập vẫn đang tiếp tục.

cryptonews.ru24 phút trước

Sui tích hợp chữ ký kháng lượng tử

cryptonews.ru24 phút trước

QCP Capital: Bitcoin Đã Đối Phó Với Đợt Bán Của Strategy Và Vụ Hacker Ví Coldcard

Công ty giao dịch QCP Capital nhận định bitcoin đã thể hiện khả năng phục hồi đáng chú ý, vượt qua áp lực bán từ công ty Strategy và vụ vi phạm bảo mật lớn của ví Coldcard (ước tính thiệt hại ~1.755 BTC). Giá BTC phục hồi từ ~62,5k USD lên gần 64k USD. Thị trường quyền chọn cũng phản ánh sự ổn định tương đối: biến động ngầm định ngắn hạn ở mức thấp, rủi ro đảo chiều (risk-reversal) thu hẹp và định vị giao dịch cân bằng hơn với hoạt động bán quyền chọn bán (put) ở mức 50.000 USD và mua quyền chọn mua (call) có chọn lọc ở 65.000 USD. Bối cảnh vĩ mô hỗn hợp: hoạt động sản xuất Mỹ mạnh nhưng thị trường lao động có dấu hiệu hạ nhiệt. Căng thẳng địa chính trị tại eo biển Hormuz và các động thái can thiệp tiền tệ liên quan đến đồng Yên Nhật vẫn là nguồn biến động tiềm ẩn. Quá trình lập pháp cho tài sản số tại Mỹ (Đạo luật CLARITY) bị trì hoãn đến tháng 9. Kết luận chính: Thị trường thể hiện khả năng chống chịu (resilience) chứ không phải hoảng loạn sau một loạt cú sốc, nhưng vẫn thiếu động lực rõ ràng cho đà tăng mới. Tình hình giống như sự lặng gió sau cơn bão, chờ đợi làn gió mới định hướng.

cryptonews.ru35 phút trước

QCP Capital: Bitcoin Đã Đối Phó Với Đợt Bán Của Strategy Và Vụ Hacker Ví Coldcard

cryptonews.ru35 phút trước

Giao dịch

Giao ngay
活动图片