Vừa rồi, cả Anthropic và OpenAI đồng thời ra mắt bản nâng cấp lớn cho chế độ giọng nói!
Bên phía Claude, từ chỉ chạy được Haiku nay đã nâng cấp lên toàn bộ dòng Opus 4.8 và Sonnet 5, không chỉ có thể gọi các công cụ như Gmail, lịch, Slack trong cuộc trò chuyện, mà còn mở rộng lên 11 ngôn ngữ, nhưng không có tiếng Trung.

Bên phía OpenAI, GPT-Live song công toàn phần đã được đưa thẳng lên máy tính để bàn macOS và Windows, chỉ cần mở miệng là có thể chỉ huy cả một đội Agent cùng lúc, và hỗ trợ tiếng Trung.

Claude Voice nâng cấp lớn
Trước đó, chế độ giọng nói của Claude chỉ có thể chạy Haiku, tức là mô hình nhỏ nhất.
Bạn trò chuyện bằng giọng nói với nó, nó có thể hiểu, nhưng những câu hỏi phức tạp hơn một chút dễ bị lỗi.
Giờ đây, cả Opus 4.8 và Sonnet 5 đều đã lên kệ.
Bạn có thể chuyển đổi mô hình giữa cuộc trò chuyện. Hệ thống tự động gọi phiên bản nhanh nhất của mô hình đã chọn. Lưu ý, là phiên bản nhanh nhất, không phải phiên bản suy luận đầy đủ.

Tin tốt là, chế độ giọng nói sẽ mặc định tải mô hình bạn đã dùng trong cuộc trò chuyện văn bản lần trước, ngữ cảnh giữa văn bản và giọng nói không bị gián đoạn, chuyển đổi qua lại liền mạch.
Về mặt tương tác, có hai chế độ: Hands-free lắng nghe liên tục và trả lời tự động, Push-to-talk nhấn giữ để nói, thả ra để kết thúc.
Tất nhiên, điều quan trọng nhất vẫn là “Gọi công cụ”.
Trong cuộc trò chuyện bằng giọng nói, giờ đây Claude có thể kết nối trực tiếp với Gmail, Google Calendar, Slack, Google Docs, Canva của bạn.
Nói một câu, nó thay bạn lật email, kiểm tra lịch, đọc tài liệu, gửi tin nhắn.
Giám đốc sản phẩm Anthropic Robert Bye đã đưa ra vài ví dụ:
· Giúp tôi tóm tắt những gì tôi đã bỏ lỡ trên Slack vài giờ qua.
· Gửi bản tóm tắt PRD dự án mới cho Nick trên Slack.
Nói xong là việc được làm.

Về mặt kỹ thuật, việc gọi công cụ trong giọng nói và trò chuyện văn bản sử dụng cùng một kiến trúc Connectors, không phải phiên bản bị cắt giảm, và mỗi lần gọi sẽ hỏi quyền của bạn trước.
Tất cả gói dịch vụ đều có thể sử dụng, nhưng người dùng miễn phí chỉ có Haiku cộng 1 bộ kết nối, muốn dùng bộ Opus đầy đủ thì phải trả tiền. Lượng dùng được trừ từ hạn mức thông thường, bắt đầu từ hôm nay sẽ triển khai thử nghiệm công khai trên toàn bộ nền tảng.
11 ngôn ngữ, không có tiếng Trung
Về mặt ngôn ngữ, lần này chế độ giọng nói Claude hỗ trợ 11 ngôn ngữ: Tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Hindi, tiếng Indonesia, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha Brazil, tiếng Tây Ban Nha Mỹ Latinh, tiếng Tây Ban Nha châu Âu.
Tìm từ đầu đến cuối xem một lần, không có tiếng Trung.
Với phần người dùng này, vẫn phải tiếp tục gõ chữ.

Hơn nữa Claude không tự động phát hiện bạn đang nói ngôn ngữ gì.
Bạn phải chủ động mở miệng bảo nó chuyển, ví dụ “Hãy nói chuyện với tôi bằng tiếng Nhật”, hoặc vào cài đặt để chọn thủ công. Nếu không chuyển, mặc định là tiếng Anh.
Điều thú vị là, trước đó có nhà phát triển đã lục ra từ mã nguồn ứng dụng Claude một danh sách ngôn ngữ, bao gồm 18 ngôn ngữ, trong đó có ghi rõ Chinese.
Kết quả, 18 biến thành 11, tiếng Trung trực tiếp bị cắt.

ChatGPT Voice tiến vào máy tính để bàn
Ngược lại, giọng nói của ChatGPT thì từ tầng dưới cùng đã thay đổi một kiến trúc hoàn toàn mới.
Nó sử dụng GPT-Live vừa được phát hành vào ngày 8 tháng 7, một mô hình giọng nói song công toàn phần.
Cái gọi là song công toàn phần là, mô hình có thể xử lý đồng thời luồng âm thanh đầu vào và đầu ra, và đưa ra hàng chục quyết định mỗi giây, không cần đợi bạn nói xong mới phản hồi .
Vì vậy GPT-Live sẽ nói “ừm”, “hiểu rồi” khi bạn đang nói, giống như người thật đang lắng nghe.
Tiến thêm một bước nữa, nó dựa trên một kiến trúc hai tầng.
Tiền cảnh là một mô hình giọng nói nhẹ, độ trễ thấp, chịu trách nhiệm đối thoại thời gian thực, quản lý lượt, phản hồi ngắt lời, tất cả những việc cần phản ứng trong mili giây.
Hậu cảnh là GPT-5.5, chịu trách nhiệm suy luận phức tạp, tìm kiếm web, nhiệm vụ Agent.
Khi bạn hỏi một câu hỏi cần suy nghĩ sâu, GPT-Live sẽ ủy thác nhiệm vụ bất đồng bộ cho GPT-5.5 ở hậu cảnh, sau đó tự tiếp tục trò chuyện với bạn, đợi kết quả rồi báo cáo.
OpenAI gọi đây là “Suy luận ủy thác” (Delegated Reasoning).

Cụ thể là, OpenAI đã tách rời hoàn toàn độ trễ đối thoại và độ sâu suy luận. Bạn không cần phải đợi mô hình lớn suy nghĩ xong mới có thể tiếp tục nói.
Độ sâu suy luận còn có thể điều chỉnh ba mức: Instant nhanh nhất, Medium suy luận trung bình, High suy luận sâu, tương ứng với các mức khác nhau của GPT-5.5. Người dùng miễn phí sử dụng GPT-Live-1 mini.
Từ điểm chuẩn, kiến trúc ủy thác này thực sự hiệu quả, chế độ giọng nói cuối cùng không còn là “phiên bản trò chuyện giảm cấp” nữa.
GPQA (suy luận khoa học cấp chuyên gia) từ 45.3% của chế độ giọng nói cao cấp trước đó nhảy lên 84.2%.
BrowseComp (khả năng tìm kiếm web của Agent) từ 0.7% tăng vọt lên 75.2%.
Trong tiêu chuẩn điểm chuẩn τ3-Voice Telecom mô phỏng cảnh dịch vụ viễn thông nhiều lượt thực tế, GPT-Live cũng áp đảo toàn diện.



Vừa nói, nhiều Agent chạy đồng thời
Có được nền tảng này, OpenAI đã đưa nó thẳng lên máy tính để bàn.
Từ hôm nay, ChatGPT Voice chính thức đổ bộ lên phiên bản máy tính để bàn macOS và Windows.
Bạn có thể đặt một phím tắt toàn cục, trong bất kỳ ứng dụng nào cũng có thể một phím gọi ra ChatGPT Voice.
Trên macOS còn có chức năng Appshots, ChatGPT có thể đọc trực tiếp nội dung cửa sổ đang hoạt động hiện tại của bạn, như là ngữ cảnh của cuộc trò chuyện.
Ví dụ, khi nói với Excel “giúp tôi tính tỷ lệ so với cùng kỳ năm ngoái của Q3”, nó có thể nhìn thấy bảng tính của bạn.

Ngoài ra, bạn còn có thể dùng giọng nói chỉ huy nhiều Agent đồng thời làm việc trong ChatGPT Work và Codex.
Một bên để một Agent viết code, một bên để một Agent khác tra tài liệu, chỉ cần nói ra.
GPT-Live ở tiền cảnh nói chuyện với bạn, hậu cảnh đồng thời khởi động, kiểm tra, chuyển đổi nhiều luồng công việc, không cần bạn quay lại bàn phím.
Hiện tại, các gói Plus, Pro, Business, Edu, Enterprise có thể sử dụng.
Khoảng cách có thể cảm nhận trong 10 giây
Có thể ngắt lời không
Giọng nói Claude là chế độ luân phiên, bạn nói xong nó mới suy nghĩ. Muốn ngắt lời? Hãy đợi.
GPT-Live có thể bị ngắt lời. Bạn nói đến nửa chừng đổi ý, nó lập tức dừng lại và theo kịp ý tưởng mới của bạn. Nó vẫn nhớ đã nói đến đâu trước khi bị ngắt.
Có thể làm nhiều việc cùng lúc không
Claude một lần chỉ làm một việc – trò chuyện bằng giọng nói.
ChatGPT Voice trên phiên bản máy tính để bàn có thể vừa nói chuyện với bạn, vừa điều khiển máy tính ở hậu cảnh, chỉ huy nhiều Agent làm việc riêng.
“Giúp tôi mở một PR, đồng thời kiểm tra nhật ký CI hôm qua”, hai việc có thể bắt đầu chạy cùng lúc.
Có thể động tay không
Giọng nói Claude có thể gọi các công cụ SaaS như Gmail, lịch thông qua bộ kết nối, nhưng nó không chạm được vào máy tính để bàn của bạn.
ChatGPT Voice trên phiên bản máy tính để bàn kết hợp với Computer Use, có thể trực tiếp điều khiển máy tính của bạn. Tệp, chương trình, terminal, nó đều có thể chạm vào.
Suy nghĩ sâu đến mức nào
Lá bài tẩy của Claude là Opus 4.8, trong các nhiệm vụ suy luận nhiều bước và tổng hợp kiến thức vẫn là một trong những mô hình mạnh nhất. Nhưng chế độ giọng nói chạy phiên bản nhanh nhất của Opus, không phải phiên bản suy luận đầy đủ.
Bên phía GPT-Live, mức High có thể ủy thác bất đồng bộ cho GPT-5.5 Thinking thực hiện suy luận sâu, ngược lại có thể gọi khả năng suy luận gần như đầy đủ trong ngữ cảnh giọng nói.

Thời đại không cần ô nhập liệu
Đọc đến đây, sự phân kỳ của hai bên đã rõ ràng.
Claude theo chế độ luân phiên, chủ đạo là dùng Gmail, lịch, tài liệu của chính bạn, giúp bạn sắp xếp công việc của mình.
GPT-Live song công toàn phần, chủ đạo là nói chuyện như với một con người. Có thể ngắt lời, có thể đa luồng, có thể điều khiển máy tính, khiến bạn quên rằng đối diện là AI.
Với người không viết code, Claude có ngưỡng cửa thấp hơn nhiều, có email cần sắp xếp, lịch trình cần sắp xếp, chỉ cần mở miệng là được.
Con đường của OpenAI thì sướng hơn và cũng geek hơn, bạn phải thực sự có một đội Agent trong tay, có việc thực sự cho chúng làm.
Như Greg Brockman đã nói, “So với giọng nói, việc gõ chữ vốn đã rất không tự nhiên.”
Chiếc phím nhựa đã đồng hành cùng con người bốn mươi năm, giờ chính thức bị OpenAI và Anthropic cùng nhau đẩy vào chân tường.

Tài liệu tham khảo:
https://x.com/testingcatalog/status/2080401533728940372
https://x.com/OpenAI/status/2080378182469857576
https://x.com/testingcatalog/status/2080385285951521150
https://x.com/claudeai/status/2080376094939603366
https://claude.com/blog/think-through-hard-problems-in-voice-mode
Bài viết này đến từ tài khoản WeChat công cộng “Tân Trí Nguyên”, tác giả: ASI Khải Thị Lục, biên tập: Môi Tây





