ChatGPT语音杀入桌面,你负责动嘴,一群AI负责干活

marsbit發佈於 2026-07-27更新於 2026-07-27

文章摘要

近日,OpenAI将ChatGPT语音功能正式引入桌面版应用,支持在Work与Codex场景中使用。用户可以通过语音直接指挥AI执行任务,如启动任务、调整优先级、协调多个智能体并行工作等,且系统能够结合本地文件、日历、邮件等上下文信息进行连续处理。此次升级基于新一代语音模型GPT-Live,实现实时听说的交互方式,大幅提升了信息输入效率。 行业人士如Andrej Karpathy、马斯克等人也强调了语音输入的优势:它能以更高带宽传递复杂意图,将零碎、跳跃的思维直接传递给AI,并由AI整理成清晰指令,减少了键盘输入带来的信息损耗。语音输入不仅解放双手,更成为高效调度AI的入口。 OpenAI此举旨在将ChatGPT打造为“AI工作操作系统”,让用户像管理者一样通过语音指挥AI团队完成复杂工作,推动人机交互从“问答式”向“指挥式”转变。未来,随着输入瓶颈的突破,人类可将更多精力集中于决策与创造。

近日,Andrej Karpathy分享了一个他自己很爱用的懒办法:想让AI干活,又懒得一个字一个字把需求打清楚,怎么办?

他说,那就靠回椅背切到语音,意识流全开,说个10分钟,一团乱麻、怎么说都行。

有时开口先和AI声明一句「切语音识别了,别介意错别字」。

神奇的是,他发现AI特别擅长把这种又长又乱的碎碎念重新拼起来,回给你的版本,往往比你自己说的还干净:你脑子里那团纠缠的想法被它捋顺了,来回纠偏的次数也变少了。

这正是Andrej Karpathy自己跟AI打交道最顺手的一种方式。

用他的话说,这能改善人和模型之间的「心智融合」,人常常懒得把一件事的来龙去脉一个字一个字敲清楚,那还不如干脆开口,把整团乱麻一股脑倒出去。

语音的价值不在解放双手,而在把上下文高带宽地倒给AI。

就在这几天,OpenAI干脆把这套「用嘴指挥AI」的玩法,直接搬进了桌面。

桌面版ChatGPT,现在能用嘴指挥了

7月23日,OpenAI把ChatGPT语音(Voice)正式送进桌面版App的Work与Codex场景。

当天起在macOS和Windows上全球分批推送,覆盖Plus、Pro、Business、Edu、Enterprise各档,Android即将跟上,iOS则通过Remote配对远程接入。

它的底层,是7月8日刚上线的新一代语音模型GPT-Live,能同时听和说:你随时打断,它接着你最新那句往下走,而不再是老式那种「先录音、再转文字、然后回你一句」的笨办法。

关键在于,这次语音不只是拿来闲聊。

在Work和Codex里,你张嘴就能启动一个任务、问它跑到哪了、看某个智能体现在什么状态,还能在同一段对话里同时协调好几个Agent,让它们各干各的。

任务在后台跑着,你随时插一句让它换方向;它卡住了或干完了,会主动开口,或在屏幕上给你提个醒。

它甚至能顺着你手头的活儿往下接:调用已有的项目上下文,连上文档、日历、联系人和通讯记录,把一件做了一半的事收尾。

官方也给出了一些日常生活实例:让它查日历有没有冲突、翻邮箱看航班改没改、顺手把会议纪要备好,「趁你泡咖啡或者忙别的」,这些活在后台自己就跑完了。

macOS上还多一手Appshots和屏幕上下文,能直接读你当前最前面那个窗口,结合本地文件和代码库一起理解,热键也能自定义。

Codex加ChatGPT Work的周活已经过了1000万。

OpenAI发的宣传片里有个画面很有意思:几名工程师站在同一个房间,对着同一个桌面会话,各说各的指令:一个AI,一屋子人围着它下命令。

这大概就是他们想象的「群体编程派对」。

OpenAI用一段居家场景演示ChatGPT Voice:开口把想做的事说给桌面版Codex,它在后台接着干。

打字是AI输入瓶颈,但语音不是

这当然不是OpenAI一家心血来潮。

几乎同一周,三个行业大佬几乎不约而同地把票投给了「语音」。

Karpathy在X上发帖,他说上下文太多、又懒得打字的时候,就乱聊一通,让AI去整理。

一位Grok的铁粉转发了Karpathy的帖子,说自己早用惯了Grok的语音转文字,「现在打字都觉得像上刑」,还顺便吐槽了Anthropic的语音输入「其实还挺基础的」。

马斯克把这条又转了出去,补上一句:你可以像跟人说话一样,用Grok Build把任务交给Grok去干。

奥特曼也不忘推销自己新一代语音模型GPT-Live。

他自曝一向更爱打字不爱跟AI说话,但如今他跟ChatGPT「说的已经比打的多了」。

他还专门点出:当你有一大堆上下文要一次性倒给AI的时候,语音最好用。

让三位大佬兴奋的,其实不是「终于能用嘴了」这么简单。

这背后藏着这样一个逻辑:智能体越来越强,你要喂给它的意图也越来越复杂,键盘这条管道就开始拥堵了:

你打得越省事,模型拿到的信息就越干瘪。

而语音输出,则是天生的宽管道:你能一口气把前因后果、顾虑偏好全说出来,哪怕说得乱,模型也能兜住,再替你把那团意识流理清楚。

社区里已经有人实测:语音吞吐大概每分钟240个词,打字顶多70到80个词,差了三四倍。

GPT-Live把重活甩给后台的GPT-5.5、GPT-5.6去想,前台只管让对话流畅地接住你,这套解耦,恰恰是为了让人们可以随便开口。

说到底,人脑里的想法本就是并行的、跳跃的,键盘却逼你压成一行一行的字。

而语音让这道墙松动了:它正从一个「偷懒的输入法」,变成一个「高带宽的上下文入口」。

一句话,打字是AI输入的瓶颈,但语音不是。

语音输入背后,是「用嘴管项目」

OpenAI这次真正塞进桌面版的,是让语音去「管AI」。

按官方FAQ,在Work和Codex里,你开口能干这些事:启动一个任务,给几个任务排优先级,中途打断、掉头改方向,而活儿在后台继续跑。

更进一步,它能在多个对话和项目之间,协调好几个智能体一起干。你说一句「A先做,B先挂着,C出结果了叫我」,后台就照着重排。

它还能接着上次的活儿往下干。靠的是项目上下文,加上连接进来的工具,你的文档、日历、联系人、通讯记录。

任务卡住了或者干完了,它会用语音或者屏幕上的提示告诉你一声。

这已经不是语音输入法的活儿了,它更像一个中枢,你在上面调度一支智能体团队。

同样是开口和AI说话,以往是让AI听懂你,现在是让AI替你干活。

ChatGPT想当的,是你的「AI工作操作系统」

一个语音功能背后,藏着一条更大的路线:OpenAI想让ChatGPT做你的「AI工作操作系统」。

这几个月,OpenAI一直在重做桌面版ChatGPT,把Chat、Work、Codex放进了同一个入口,一键切换,在后台长期跑着。

Codex,也早扩成了能并行多个智能体、跑长任务、读懂整个项目的通用平台。

为什么把这套能力放桌面,而不是留在人人都在用的手机上?

主要是因为手机那块小小的聊天框干不了复杂活儿,它适合随口问两句。

真要让AI连着你的文件、代码和软件,把一件事从头做到尾,它就得待在你的电脑里:

桌面才有文件、集成开发环境(IDE)、浏览器、一整套企业办公软件,这才是智能体干活的主战场。

这背后,是一次人类与AI交互方式的翻转。

过去你用AI,是在「操作软件」:打开、输入、等待,一个回合一个回合地来。

现在你更像个带团队的经理:开口把任务分下去,你和AI的关系,从「你问它答」,悄悄变成了「你说它做」。

一位重度用户干脆说,这套东西用起来「基本就是贾维斯」。

他甚至让Codex帮自己配了个快捷键,一开口就能在三台机器、几块屏幕之间来回切换。

回到开头那个场景,真正让马斯克、奥特曼、Karpathy等大佬们兴奋的,不是可以扔掉键盘了,而是当输入不再是瓶颈,人可以把省下来的那点脑力,还给真正值得琢磨的事:决策。

所以下一个问题,其实不是「你能不能开口」,而是当你面前站着一屋子随叫随到的AI,你到底想让它们,替你做什么。

参考资料:

https://x.com/OpenAI/status/2080378182469857576

https://aihot.virxact.com/items/cmrxxi2qg03kcroxpcugdaldy

本文来自微信公众号“新智元”,作者:ASI启示录

相關問答

QAndrej Karpathy推荐的与AI高效互动的方式是什么?

AAndrej Karpathy推荐的是一种通过语音与AI互动的方式。他建议靠在椅背上,完全放开思路,进行长达10分钟的意识流式语音输入,即使内容杂乱、充满错别字也无妨。他发现AI特别擅长将这种杂乱、冗长的碎碎念重新整理和归纳,给出的回复版本往往比用户自己表达的更清晰有条理,从而减少了来回纠偏的次数,改善了人与模型之间的“心智融合”。

QOpenAI将ChatGPT语音功能集成到桌面版后,主要在哪些场景中发挥作用?

AOpenAI将ChatGPT语音功能集成到了桌面版App的“Work”与“Codex”场景中。在此场景下,用户可以通过语音指令来启动任务、查询任务进度、管理多个智能体(Agent)的工作状态。它能够调用项目上下文、连接文档、日历、联系人等本地信息,并在后台持续运行任务,用户可随时插话更改任务方向,任务完成后或遇到障碍时会通过语音或屏幕提示通知用户。这实现了从“用嘴指挥AI理解”到“用嘴指挥AI干活”的转变。

Q根据文章,语音输入相比打字输入的主要优势是什么?

A语音输入相比打字输入的主要优势在于其“高带宽”的信息传输能力。人类说话的速度(约每分钟240词)远高于打字速度(约每分钟70-80词),这使人能够更自然、更快速地将复杂的想法、完整的前因后果和顾虑偏好一次性传达给AI。即使表达杂乱,AI也能有效理解和梳理。这打破了键盘输入迫使思维线性化的限制,让并行的、跳跃的思维得以更流畅地传递,从而成为更高效的“上下文入口”,解决了意图复杂时打字输入的瓶颈问题。

QOpenAI将语音深度集成到桌面版ChatGPT,背后反映了其怎样的战略意图?

A这反映了OpenAI意图将ChatGPT打造成为用户的“AI工作操作系统”的战略方向。通过将Chat、Work、Codex整合到桌面端,并赋予其通过语音调度多个智能体、管理长任务、连接本地文件和应用的能力,OpenAI希望改变人机交互模式。用户从过去“操作软件”的回合制问答,转变为像“项目经理”一样,通过口头指令分配和协调一支AI团队来完成复杂工作。桌面环境提供了文件、IDE、办公软件等完整的工作生态,是智能体发挥作用的主战场,这标志着AI正从工具演变为工作中的核心协作者与执行中枢。

Q文章中提到,新一代语音模型GPT-Live在技术上有何特点?

A新一代语音模型GPT-Live的主要特点是能够“同时听和说”,实现流畅的实时交互。它不再是传统的“先录音、再转文字、然后处理回复”的异步模式,而是允许用户随时打断AI的发言,AI能基于用户最新的一句话继续对话。其技术架构将繁重的思考任务卸载给后台的GPT-5.5或GPT-5.6等大模型,而前台专注于保障对话的连贯性和自然度。这种“解耦”设计旨在降低用户的使用心理负担,让人们可以更随意地开口说话,而无需担心表达不完美。

你可能也喜歡

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击,许多人担心工作被取代。然而,真正的威胁在于个人对他人和系统的依赖,以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键,不是抵制技术,而是成为拥有高自主性的“不可受雇”个体。 文章提出了成功抵御AI替代的五个核心要素:自主性(主动行动的能力)、品味(判断事物价值的经验)、说服力(让他人关注你工作的能力)、毅力(坚持并从错误中学习)和迭代(根据反馈持续改进)。这些能力无法仅通过理论学习获得,必须通过实践来培养。 要启动转变,首先要彻底改变环境,重塑身份认同。其次,应选择一个能获得真实、快速反馈的实践领域,例如创业。在众多技能中,内容创作(媒体)比编写代码更具优势,因为其价值是主观的,需要独特的审美和判断力,这正是AI目前难以完全复制的。 具体行动上,可以从三个步骤开始: 1. **挖掘原始素材**:反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣,找到独特的个人经验。 2. **确立反向思考主轴**:找出你坚信但主流观点错误的地方,或行业内普遍忽视的“皇帝新衣”,形成独特的批判性视角。 3. **立即发布**:将前两步的思考融合,撰写并发布第一个核心内容(如帖子、视频),勇敢接受真实世界的反馈,并在此基础上持续学习和迭代。 最终,抵御AI的关键在于构建一份与自身身份深度契合的毕生事业,通过持续的内容创作和真实互动,建立无法被自动化取代的独特价值和影响力。行动,从今天发布第一个想法开始。

marsbit3 小時前

如何让自己变得让人工智能永远也无法取代

marsbit3 小時前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下: **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定,理论上虽可预测,但实践中无法被攻击者复制或计算,从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵,50次投掷即可满足典型12词助记词(128比特熵)的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷,致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响,因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示:手工种子并非万能保护** 安全研究员指出,即使用户使用骰子生成了安全的种子,若他们使用了Coldcard的其他功能(如生成纸钱包、克隆密钥、共享签名密钥、密码等),这些**衍生密钥**仍可能调用有漏洞的随机数生成器,从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠,但该方法对大多数用户并不友好: * **过程繁琐易错**:需投掷50-99次,精确记录,任何输入错误都会导致钱包完全不同。 * **引入新风险**:用户可能在记录、转换过程中泄露信息,或使用有偏的骰子/投掷方式。 * **用户体验差**:难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应: * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码,如有则需立即更换。 * 考虑采用多签方案,使用不同厂商的设备分散风险。 **结论**:手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项,但其过程复杂、容易出错,不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru6 小時前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

cryptonews.ru6 小時前

交易

現貨
活动图片