Gần đây, Andrej Karpathy đã chia sẻ một phương pháp lười biếng mà anh rất thích: muốn AI làm việc, nhưng lại lười không muốn gõ rõ ràng từng chữ một yêu cầu, thì phải làm sao?
Anh nói, hãy ngả lưng vào ghế, chuyển sang chế độ giọng nói, mở toàn bộ dòng ý thức, nói liền 10 phút, nói lộn xộn, nói kiểu gì cũng được.
Đôi khi mở miệng trước, nói với AI một câu "Đã chuyển sang nhận diện giọng nói, đừng để ý lỗi chính tả nhé".
Kỳ diệu là, anh phát hiện ra AI đặc biệt giỏi trong việc ghép lại những lời lẽ dài dòng, lộn xộn, rối rắm này, và bản mà nó trả lại cho bạn thường sạch sẽ hơn cả chính bạn nói: mớ ý nghĩ rối ren trong đầu bạn được nó gỡ ra, số lần phải chỉnh sửa đi chỉnh sửa lại cũng giảm đi.
Đây chính xác là cách mà Andrej Karpathy cảm thấy thuận tiện nhất khi làm việc với AI.

Nói như anh ấy, điều này có thể cải thiện "sự hòa nhập tâm trí" giữa con người và mô hình, con người thường lười không muốn gõ rõ ràng từng chữ một đầu đuôi câu chuyện, vậy chi bằng cứ mở miệng nói, đổ hết đống rối rắm ấy ra.
Giá trị của giọng nói không nằm ở việc giải phóng đôi tay, mà nằm ở việc đổ ngữ cảnh với băng thông cao cho AI.
Ngay trong mấy ngày qua, OpenAI đã thẳng tay đưa lối chơi "dùng miệng chỉ huy AI" này vào môi trường desktop.
Phiên bản desktop của ChatGPT, giờ có thể dùng miệng để chỉ huy
Ngày 23/7, OpenAI chính thức đưa tính năng giọng nói (Voice) của ChatGPT vào các tình huống Work và Codex trong ứng dụng phiên bản desktop.

Từ ngày đó, tính năng được triển khai theo từng đợt toàn cầu trên macOS và Windows, bao phủ các gói Plus, Pro, Business, Edu, Enterprise. Android sẽ sớm theo kịp, iOS thì thông qua Remote pairing để truy cập từ xa.
Nền tảng của nó là mô hình giọng nói thế hệ mới GPT-Live vừa ra mắt ngày 8/7, có thể vừa nghe vừa nói: bạn có thể ngắt lời bất cứ lúc nào, và nó sẽ tiếp tục từ câu mới nhất của bạn, chứ không còn là cách thức cũ kỹ "ghi âm trước, chuyển thành văn bản, rồi trả lời bạn một câu".
Điểm mấu chốt là, lần này giọng nói không chỉ dùng để trò chuyện phiếm.
Trong Work và Codex, bạn có thể mở miệng ra để khởi động một nhiệm vụ, hỏi nó đang chạy đến đâu, xem trạng thái hiện tại của một agent thông minh nào đó, đồng thời có thể điều phối nhiều Agent cùng lúc trong cùng một đoạn hội thoại, để chúng làm việc riêng của mình.
Nhiệm vụ chạy ở chế độ nền, bạn có thể chèn một câu bất cứ lúc nào để yêu cầu nó đổi hướng; khi nó bị kẹt hoặc hoàn thành, nó sẽ chủ động lên tiếng, hoặc đưa ra lời nhắc trên màn hình cho bạn.
Nó thậm chí có thể tiếp nối công việc bạn đang làm: gọi ngữ cảnh dự án có sẵn, kết nối với tài liệu, lịch, danh bạ và bản ghi liên lạc, để hoàn thành nốt một việc đang làm dở.
OpenAI cũng đưa ra một số ví dụ từ cuộc sống hàng ngày: nhờ nó kiểm tra lịch xem có xung đột không, lục hộp thư xem chuyến bay có thay đổi không, tiện tay chuẩn bị biên bản cuộc họp, "trong lúc bạn pha cà phê hoặc bận làm việc khác", những việc này sẽ tự chạy xong ở chế độ nền.
Trên macOS còn có thêm tính năng Appshots và ngữ cảnh màn hình, có thể đọc trực tiếp cửa sổ bạn đang mở phía trước nhất, kết hợp với các tệp cục bộ và kho mã nguồn để cùng hiểu, phím tắt cũng có thể tùy chỉnh.
Hoạt động hàng tuần của Codex cộng với ChatGPT Work đã vượt qua 10 triệu.
Có một cảnh thú vị trong video quảng cáo mà OpenAI đăng tải: vài kỹ sư đứng trong cùng một phòng, cùng đối mặt với một phiên làm việc desktop, mỗi người nói lệnh của riêng mình: một AI, cả phòng người vây quanh ra lệnh cho nó.
Đây có lẽ là hình ảnh "bữa tiệc lập trình tập thể" mà họ tưởng tượng.

OpenAI minh họa ChatGPT Voice bằng một cảnh gia đình: nói ra việc muốn làm cho phiên bản desktop Codex, nó sẽ tiếp tục làm ở chế độ nền.
Gõ chữ là nút thắt đầu vào của AI, nhưng giọng nói thì không
Tất nhiên đây không phải là ý tưởng bất chợt của riêng OpenAI.
Gần như cùng tuần đó, ba ông lớn trong ngành hầu như không hẹn mà cùng bỏ phiếu cho "giọng nói".
Karpathy đăng bài trên X, nói rằng khi ngữ cảnh quá nhiều, lại lười gõ, thì cứ nói lung tung một tràng, để AI đi sắp xếp.
Một fan cứng của Grok chuyển tiếp bài đăng của Karpathy, nói mình đã quen dùng chức năng chuyển giọng nói thành văn bản của Grok, "giờ mà gõ chữ cảm giác như bị tra tấn", tiện thể chê tính năng nhập giọng nói của Anthropic "thực ra còn khá cơ bản".
Musk lại chuyển tiếp dòng này, thêm một câu: Bạn có thể giao nhiệm vụ cho Grok thực hiện bằng Grok Build, giống như nói chuyện với người vậy.

Altman cũng không quên quảng bá mô hình giọng nói thế hệ mới GPT-Live của mình.
Anh tự tiết lộ vốn thích gõ chữ hơn nói chuyện với AI, nhưng giờ đây anh "nói với ChatGPT còn nhiều hơn là gõ".

Anh còn đặc biệt chỉ ra: Khi bạn có một đống ngữ cảnh cần đổ một lúc cho AI, giọng nói là hữu ích nhất.
Điều khiến ba ông lớn phấn khích, thực ra không đơn giản chỉ là "cuối cùng cũng có thể dùng miệng".
Đằng sau đó ẩn chứa một logic: Agent ngày càng mạnh, ý định bạn cần cung cấp cho nó cũng ngày càng phức tạp, đường ống bàn phím bắt đầu bị tắc nghẽn:
Bạn gõ càng tiết kiệm công sức, thông tin mà mô hình nhận được càng khô khan.
Trong khi đó, đầu ra bằng giọng nói vốn dĩ là một đường ống rộng: Bạn có thể một hơi nói hết nguyên nhân hậu quả, mối quan tâm, sở thích, dù nói có lung tung, mô hình cũng có thể đỡ được, rồi thay bạn sắp xếp lại dòng ý thức hỗn độn đó.
Trong cộng đồng đã có người thử nghiệm thực tế: Tốc độ thông qua của giọng nói khoảng 240 từ/phút, gõ chữ tối đa chỉ 70 đến 80 từ/phút, chênh nhau gấp 3-4 lần.
GPT-Live giao phần việc nặng cho GPT-5.5, GPT-5.6 ở chế độ nền suy nghĩ, phần giao diện chỉ đảm nhiệm việc đón nhận cuộc hội thoại một cách trôi chảy, sự tách biệt này chính là để mọi người có thể thoải mái mở miệng nói.
Nói cho cùng, ý nghĩ trong đầu con người vốn là song song, nhảy cóc, nhưng bàn phím lại ép bạn nén thành từng dòng chữ.
Mà giọng nói làm rung chuyển bức tường này: nó đang từ một "phương pháp nhập liệu lười biếng", trở thành một "cổng vào ngữ cảnh băng thông cao".
Nói một câu, gõ chữ là nút thắt đầu vào của AI, nhưng giọng nói thì không.
Đằng sau đầu vào bằng giọng nói, là "quản lý dự án bằng miệng"
Thứ mà OpenAI thực sự nhồi vào phiên bản desktop lần này, là để giọng nói "quản lý AI".
Theo FAQ chính thức, trong Work và Codex, bạn có thể mở miệng làm những việc này: Khởi động một nhiệm vụ, sắp xếp thứ tự ưu tiên cho vài nhiệm vụ, ngắt quãng giữa chừng, rẽ hướng thay đổi, trong khi công việc vẫn tiếp tục chạy ở chế độ nền.
Tiến thêm một bước, nó có thể điều phối nhiều agent thông minh cùng làm việc giữa nhiều cuộc hội thoại và dự án khác nhau. Bạn nói một câu "A làm trước, B treo lên trước, C có kết quả thì gọi tôi", chế độ nền sẽ sắp xếp lại theo đó.
Nó còn có thể tiếp tục công việc lần trước. Dựa vào ngữ cảnh dự án, cộng với các công cụ được kết nối vào: tài liệu, lịch, danh bạ, bản ghi liên lạc của bạn.
Khi nhiệm vụ bị kẹt hoặc hoàn thành, nó sẽ dùng giọng nói hoặc lời nhắc trên màn hình để báo cho bạn.
Đây không còn là việc của một phương pháp nhập liệu bằng giọng nói nữa, nó giống một trung tâm điều phối hơn, nơi bạn sắp xếp một đội ngũ agent thông minh.
Cũng là mở miệng nói chuyện với AI, trước đây là để AI hiểu bạn, bây giờ là để AI làm việc thay bạn.
ChatGPT muốn trở thành, "Hệ điều hành công việc AI" của bạn
Một tính năng giọng nói đằng sau, ẩn chứa một lộ trình lớn hơn: OpenAI muốn biến ChatGPT thành "Hệ điều hành công việc AI" của bạn.
Mấy tháng qua, OpenAI liên tục làm lại phiên bản desktop ChatGPT, đưa Chat, Work, Codex vào cùng một cổng vào, chuyển đổi bằng một cú nhấp, chạy lâu dài ở chế độ nền.
Codex, cũng đã mở rộng thành một nền tảng chung có thể chạy nhiều agent song song, thực hiện nhiệm vụ dài, hiểu toàn bộ dự án.
Tại sao lại đặt bộ khả năng này lên desktop, mà không giữ lại trên điện thoại di động - thứ mà ai cũng dùng?
Chủ yếu là vì khung chat nhỏ bé trên điện thoại không làm được việc phức tạp, nó chỉ phù hợp để hỏi vài câu.
Thực sự muốn AI kết nối với tệp, mã nguồn và phần mềm của bạn, làm một việc từ đầu đến cuối, nó phải ở trong máy tính của bạn:
Desktop mới có tệp, môi trường phát triển tích hợp (IDE), trình duyệt, cả bộ phần mềm văn phòng doanh nghiệp, đây mới là chiến trường chính để agent làm việc.
Đằng sau đó, là một lần lật ngược cách thức tương tác giữa con người và AI.
Trước đây bạn dùng AI, là đang "vận hành phần mềm": mở, nhập, chờ đợi, từng hiệp một.
Giờ đây bạn giống một người quản lý dẫn đầu đội ngũ: mở miệng phân chia nhiệm vụ xuống, mối quan hệ giữa bạn và AI, từ "bạn hỏi nó trả lời", lặng lẽ biến thành "bạn nói nó làm".
Một người dùng nặng thẳng thắn nói, dùng bộ thứ này cảm giác "cơ bản là Jarvis".
Anh ta thậm chí còn nhờ Codex giúp mình cấu hình một phím tắt, chỉ cần mở miệng là có thể chuyển đổi qua lại giữa ba máy, mấy màn hình.
Quay lại cảnh mở đầu, thứ thực sự khiến các ông lớn như Musk, Altman, Karpathy phấn khích, không phải là có thể vứt bỏ bàn phím, mà là khi đầu vào không còn là nút thắt, con người có thể trả lại chút sức lực trí óc tiết kiệm được, cho những việc thực sự đáng suy ngẫm: quyết sách.
Vậy nên câu hỏi tiếp theo, thực ra không phải là "bạn có thể mở miệng không", mà là khi trước mặt bạn có một phòng đầy AI sẵn sàng tuân lệnh, bạn thực sự muốn chúng, thay bạn làm gì.
Tài liệu tham khảo:
https://x.com/OpenAI/status/2080378182469857576
https://aihot.virxact.com/items/cmrxxi2qg03kcroxpcugdaldy
Bài viết này đến từ tài khoản công chúng WeChat "New Zhiyuan", tác giả: ASI Apocalypse





