刚刚,Claude爆改语音,11种语言,就是没中文

marsbit发布于2026-07-24更新于2026-07-24

文章摘要

Anthropic和OpenAI同时升级了语音助手功能。Claude语音模式现已支持Opus 4.8和Sonnet 5全系列模型,能在对话中调用Gmail、日历、Slack等工具处理任务,并新增11种语言支持,但其中不包含中文。用户需手动切换语言,否则默认使用英语。 OpenAI则推出了全新的全双工语音模型GPT-Live,搭载于桌面端ChatGPT Voice。该模型能同时处理音频输入输出,实现实时打断和回应,并将复杂推理任务异步委派给后台的GPT-5.5处理。用户可通过全局快捷键唤起,在macOS上还能结合Appshots功能获取当前窗口上下文。此外,GPT-Live支持用语音同时指挥多个Agent工作,并具备直接操控电脑的能力。 两者核心差异在于:Claude采用轮流制对话,专注于集成办公套件协助处理个人事务;GPT-Live则强调拟人化的全双工交互,支持多线程任务和深度桌面集成。尽管Claude在多步推理上仍有优势,但GPT-Live在语音场景的响应速度和系统操控性上表现更突出。此次升级标志着语音交互正逐步取代传统打字输入,成为更自然的人机交互方式。

刚刚,Anthropic和OpenAI同时放出了语音模式大升级!

Claude这边,从只能跑Haiku升级到Opus 4.8和Sonnet 5全系列,不仅能在对话里调Gmail、日历、Slack,还扩增到11种语言,但没有中文

OpenAI那边,全双工GPT-Live直接搬上了macOS和Windows桌面,动动嘴就同时指挥一整队Agent,并且支持中文。

Claude Voice大升级

在此之前,Claude的语音模式只能跑Haiku,也就是最小的那个模型。

你跟它语音聊天,它能听懂,但稍微复杂一点的问题就容易翻车。

现在,Opus 4.8和Sonnet 5都上了。

你可以在对话中途切换模型。系统自动调用所选模型的最快版本。注意,是最快版本,不是完整推理版本。

好消息是,语音模式会默认加载你上次文字聊天用的模型,文字和语音之间上下文不断,无缝来回切。

交互方面,则有两种模式:Hands-free持续监听自动回复,Push-to-talk按住说话松手结束。

当然,要说最重要的,那还得是「工具调用」。

语音对话中,Claude现在可以直接连接你的Gmail、Google Calendar、Slack、Google Docs、Canva

说一句话,它替你翻邮件、查日历、读文档、发消息。

Anthropic的产品经理Robert Bye举了几个例子:

·帮我总结Slack过去几小时我错过了什么。

·把新项目PRD的摘要发给Slack上的Nick。

嘴上说完,活就干了。

技术上,语音里的工具调用和文字聊天走的是同一套Connectors架构,不是阉割版,每次调用前还会先问你要许可。

所有套餐都能用,但免费用户只有Haiku加1个连接器,Opus全套得氪金。用量从常规额度里扣,今天起全平台公测推送。

11种语言,没有中文

语言方面,Claude语音模式这次支持了11种语言:英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、巴西葡萄牙语、拉美西班牙语、欧洲西班牙语。

从头找到尾看一遍,没有中文。

对这部分用户来说,还是得继续打字。

而且Claude不会自动检测你说的是什么语言

你得主动开口让它切,比如「请用日语跟我说话」,或者去设置里手动选。不切的话,默认是英语。

有意思的是,此前有开发者从Claude App的代码中扒出过一份语言列表,包含18种语言,其中明确写着Chinese

结果,18种变11种,中文直接被砍了。

ChatGPT Voice杀入桌面

相比之下,ChatGPT的语音则是从底层换了一套全新的架构

它用的是7月8日刚发布的GPT-Live,一个全双工语音模型。

所谓全双工就是,模型能够同时处理输入和输出音频流,并且每秒做出几十次判断,不用等你说完就能回应

所以GPT-Live会在你说话中间「嗯嗯」「明白了」,像活人在听。

更进一步来看,它基于的是一个双层架构

前台是一个轻量低延迟的语音模型,负责实时对话、轮次管理、打断响应,所有需要毫秒级反应的事。

后台是GPT-5.5,负责复杂推理、网页搜索、Agent任务。

当你问一个需要深度思考的问题,GPT-Live会把任务异步委派给后台的GPT-5.5,然后自己继续跟你聊,等结果出来了再汇报。

OpenAI管这个叫「委派推理」(Delegated Reasoning)

具体来说就是,OpenAI把对话延迟和推理深度,被彻底解耦了。你不需要等大模型想完才能继续说话。

推理深度还能调三档:Instant最快,Medium中等推理,High深度推理,分别对应GPT-5.5的不同档位。免费用户用的是GPT-Live-1 mini

从跑分来看,这个委派架构是真的管用,语音模式终于不再是「降级版聊天」了。

GPQA(专家级科学推理)从此前高级语音模式的45.3%跳到84.2%

BrowseComp(Agent网页搜索能力)从0.7%飙到75.2%

模拟真实多轮电信客服场景的τ3-Voice Telecom基准,GPT-Live也全面碾压。

嘴上说着,多个Agent同时跑

有了这套底子,OpenAI直接把它搬上了桌面。

从今天起,ChatGPT Voice正式登陆macOS和Windows桌面端。

你可以设一个全局快捷键,在任何应用里一键唤起ChatGPT Voice。

macOS上还有Appshots功能,ChatGPT可以直接读取你当前活跃窗口的内容,作为对话的上下文。

比如,对着Excel说「帮我算一下Q3同比」时,它能看得到你的表格。

此外,你还可以用语音指挥ChatGPT Work和Codex里的多个Agent同时工作

一边让一个Agent写代码,一边让另一个Agent查文档,嘴上说着就行。

GPT-Live在前台跟你说话,后台同时启动、检查、切换多个工作线程,不需要你回到键盘前。

目前,Plus、Pro、Business、Edu、Enterprise套餐可用。

10秒钟就能感受到的差距

能不能打断

Claude语音是轮流制,你说完它才想。想插嘴?等着。

GPT-Live可以被打断。你说到一半改主意了,它立刻停下来跟上你新的想法。打断前说到哪儿,它还记得。

能不能一心多用

Claude一次只做一件事——语音聊天。

ChatGPT Voice在桌面端可以一边跟你说话,一边在后台操控电脑、指挥多个Agent各干各的。

「帮我开个PR,同时查一下昨天的CI日志」,两件事可以同时开始跑。

能不能动手

Claude语音可以通过连接器调用Gmail、日历这些SaaS工具,但它摸不到你的桌面

ChatGPT Voice在桌面端配合Computer Use,可以直接操控你的电脑。文件、程序、终端,它都能碰。

想得有多深

Claude的底牌是Opus 4.8,在多步推理和知识综合类任务上依然是最强模型之一。但语音模式跑的是Opus的最快版本,不是满血推理版。

GPT-Live这边,High档可以异步委派给GPT-5.5 Thinking做深度推理,反而能在语音场景下调用接近满血的推理能力。

连输入框都不需要的时代

看到这儿,两家的分岔就清楚了。

轮流制的Claude,主打的是用你自己的Gmail、日历、文档,帮你把自己那摊事理明白。

全双工的GPT-Live,主打的是像在跟一个人说话。可打断、可多线程、可操控电脑,让你忘记对面是AI。

对不写代码的人来说,Claude门槛低得多,有邮件要理、日程要排,张嘴就行。

OpenAI那条路更爽也更极客,你手里得先真有一队Agent、有真活给它们干。

正如Greg Brockman所说,「比起语音,打字这件事本来就特别不自然。」

那把陪了人类四十年的塑料按键,如今正式被OpenAI和Anthropic同时逼到了墙角。

参考资料:

https://x.com/testingcatalog/status/2080401533728940372

https://x.com/OpenAI/status/2080378182469857576

https://x.com/testingcatalog/status/2080385285951521150

https://x.com/claudeai/status/2080376094939603366

https://claude.com/blog/think-through-hard-problems-in-voice-mode

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:摩西

相关问答

QClaude语音模式大升级后,现在支持哪些模型和交互模式?

AClaude语音模式现在支持Opus 4.8和Sonnet 5全系列模型,可以在对话中途切换模型,系统自动调用所选模型的最快版本。交互方面有两种模式:Hands-free(持续监听自动回复)和Push-to-talk(按住说话松手结束)。

QClaude的语音模式在语言支持方面有什么特点?为什么没有中文?

AClaude语音模式此次支持11种语言,包括英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、巴西葡萄牙语、拉美西班牙语、欧洲西班牙语,但没有中文。文章提到,此前开发者从Claude App代码中扒出的语言列表包含18种语言且有中文,但最终发布的11种语言版本中,中文被移除了。用户需要主动用指令(如“请用日语跟我说话”)或去设置手动切换语言,否则默认使用英语。

QOpenAI新发布的GPT-Live在技术架构上有何创新?

AGPT-Live采用全新的全双工语音模型和双层架构。前台是一个轻量低延迟的语音模型,负责实时对话、轮次管理和打断响应;后台是GPT-5.5,负责复杂推理、网页搜索和Agent任务。这种“委派推理”架构将对话延迟和推理深度解耦,使得模型能在用户说话时实时回应(如插入“嗯嗯”),同时将复杂任务异步委派给后台大模型处理,等结果出来后再汇报。用户还可调节推理深度(Instant、Medium、High三档)。

QChatGPT Voice桌面版有哪些核心功能?

AChatGPT Voice桌面版(支持macOS和Windows)的核心功能包括:1. 支持全局快捷键,可在任何应用中一键唤起;2. 在macOS上具备Appshots功能,能读取当前活跃窗口内容作为对话上下文;3. 用户可用语音指挥多个Agent(如ChatGPT Work和Codex中的Agent)同时工作;4. 配合Computer Use功能,可直接操控电脑上的文件、程序和终端。这些功能使得用户能通过语音实现多任务并行处理和桌面交互。

Q文章从哪些方面对比了Claude语音和ChatGPT Voice的主要差异?

A文章从四个方面对比了Claude语音和ChatGPT Voice的主要差异:1. 能否打断:Claude是轮流制,不支持打断;GPT-Live支持实时打断并记忆上下文。2. 能否一心多用:Claude一次只做语音聊天;ChatGPT Voice可一边对话一边在后台操控电脑、指挥多个Agent并行工作。3. 能否动手:Claude可通过连接器调用SaaS工具(如Gmail、日历),但无法操控用户桌面;ChatGPT Voice在桌面端可直接操控电脑。4. 想得有多深:Claude语音模式运行的是Opus的最快版本,非满血推理版;GPT-Live的High档可异步委派给GPT-5.5进行深度推理,在语音场景下调用接近满血的推理能力。

你可能也喜欢

崔泰源离婚案落槌:揭秘SK海力士万亿帝国背后的继承暗线

2024年底,SK集团会长崔泰源在家族活动上向子女强调“饮水思源”与继承责任。此时,旗下SK海力士市值已突破1000万亿韩元,成为韩国最值钱资产,但集团第三代接班格局却与传统财阀剧本迥异。 崔泰源与前总统卢泰愚之女卢素英育有三名子女。长女崔允贞被视为最明显接班候选,她拥有生物学背景和咨询经历,现任SK生物制药高管及集团“成长支援部”主管,主导精准医疗等新业务,其婚姻也联姻AI领域创业者。 次女崔敏贞路径独特,曾自愿服役韩国海军并参与亚丁湾护航,退役后曾在SK海力士美国部门处理国际政策,后离职在硅谷创立AI医疗公司。她与曾服役美国海军陆战队的华裔企业家结婚,连接军旅与地缘政治网络。 长子崔仁根最符合传统继承人形象,毕业于布朗大学物理系,曾任职SK旗下能源公司,后转入麦肯锡首尔办公室。他公开表现极为低调,未持有集团股份,也未公开表态。 子女们的成长与父母旷日持久的离婚诉讼交织。2025年,最高法院将涉及1.38万亿韩元财产分割的判决发回重审,期间三名子女曾向法院递交未公开内容的请愿书。 随着SK海力士在AI时代成为全球核心地缘政治资产,崔家第三代继承的已非简单的企业控制权。他们被置于AI科研、华盛顿政策圈与全球投资前沿,必须证明自己有能力应对新时代的产业博弈,而非自动承接旧式家族剧本。

marsbit4小时前

崔泰源离婚案落槌:揭秘SK海力士万亿帝国背后的继承暗线

marsbit4小时前

交易

现货
活动图片