从文本到语音:谷歌、OpenAI与微软斥资数十亿押注AI语音交互

cryptonews.ru發佈於 2026-08-07更新於 2026-08-07

文章摘要

Google、OpenAI和微软正大力投资语音AI技术,推动与AI的交互方式从文本转向语音。数据显示,2026年第一季度,语音AI初创公司融资约70亿美元,是2025年同期的七倍。行业预计语音将逐渐成为与AI交互的主要方式。 谷歌指出,其AI Mode的语音和图像搜索请求持续高速增长,在美国,超过六分之一的搜索使用语音或图片。OpenAI透露,每周有超过1.5亿用户使用语音功能与ChatGPT交流,并于2026年7月推出了支持全双工对话的GPT-Live模型系列,未来可能推出基于该模型的硬件设备。微软则发布了能控制情感语调的多语言语音合成模型MAI-Voice-2,并集成于其企业服务中。 主要发展方向包括:语音与图像搜索、全双工对话模型、专用语音硬件设备以及可控情感的语音合成。这标志语音接口正从实验功能发展为独立的AI产品方向。 然而,观点指出,在技术追求“拟人化”的同时,监管风险显现,如俄罗斯要求语音机器人必须表明其AI身份。此外,当前热潮需警惕重蹈早期语音助手(如Siri、Alexa)期望过高而后市场整合的覆辙。技术普及的最终速度将取决于用户在日常场景中的接受程度。

谷歌、OpenAI和微软正积极投资于允许人们通过语音与AI助手交流的技术,押注AI语音交互相比文本查询的普及度将持续增长。这个方向越来越多地被称为“语音AI”。PitchBook提供给英国《金融时报》的数据证实了投资者的兴趣:2026年第一季度,语音AI领域的初创公司吸引了约70亿美元融资,是2025年同期融资额的七倍。

各大公司预期,口语将逐渐取代文本输入,成为与AI交流的主要方式。主要市场参与者的数据印证了这一趋势。

谷歌记录到语音与视觉查询的增长

根据谷歌的数据,自AI Mode服务推出以来,直至2026年4月至5月,其查询量每个季度都增长超过一倍。在美国,如今每六次搜索查询中就有超过一次使用语音或图像,而通过图片发起的查询数量每月增长超过40%。该公司将这一动态归因于用户越来越多地选择接近自然语言的交流形式,而非打字输入。

OpenAI的语音战略

在约9亿的ChatGPT周活跃用户中——这个数字是该公司在2026年2月底公布的——每周有超过1.5亿人使用语音和听写功能与服务交流。

2026年7月8日,OpenAI推出了GPT-Live系列模型:GPT-Live-1和轻量级的GPT-Live-1 mini。这些是全双工模型,能够同时聆听对话者并作出回应,无需经历传统的“请求-响应”停顿。它们构成了更新版ChatGPT Voice的基础。

除了软件部分,OpenAI还在准备独立的硬件设备。据彭博社消息人士透露,该公司正在开发一款基于GPT-Live的无屏幕智能音箱,配备摄像头和传感器。可能在2026年内发布公告,预计于2027年初上市。

微软开发富有表现力的语音合成技术

微软于2026年6月推出了MAI-Voice-2模型——这是一个富有表现力的语音合成器,支持15种语言,并能控制语音的情感色彩。该技术已开始集成到公司的产品中,包括Dynamics 365 Contact Center和Azure Voice Live。

各公司在语音AI领域的主要战略方向包括:

  • 通过口语和图像进行搜索以及与AI助手交互

  • 全双工语音模型,实现更自然的对话

  • 用于语音交互的独立硬件设备

  • 具有情感控制的企业级语音合成服务

投资的增长以及谷歌、OpenAI和微软几乎同步的产品发布表明,语音界面正在从实验性功能范畴,转变为AI产品发展的一个独立方向。此类技术的进一步普及将取决于用户在日常生活场景中适应新交互方式的速度。

AI观点

从监管动态来看,语音AI的繁荣蕴含着投资方和开发者可能忽视的风险:用户对界面“拟人程度”的信任度。当谷歌、OpenAI和微软竞相提升对话的自然度时,俄罗斯国家杜马的议员们已向联邦反垄断局提交提案,要求语音机器人在通话一开始就必须披露其非人类本质。这种在追求“临场感”的技术竞赛与监管机构试图维系人机界限之间的裂痕,很可能成为与投资规模同等重要的市场因素。

历史经验提示我们需要保持谨慎:早在Siri和Alexa早期版本时代,语音助手就经历过期望过高的周期,当时的大规模采用并未兑现货币化预期。当前的这股全双工模型浪潮,究竟是技术认知的真正转变,还是同一周期的又一次轮回,这个问题仍有待解答。

end-content

相關問答

Q根据文章,Google、OpenAI和微软在哪个AI领域投入巨资并认为其将超越文本交互?

A根据文章,Google、OpenAI和微软正在巨资投入“语音AI”或“语音交互”领域。它们认为,通过语音与AI助手交流将逐渐取代文本输入,成为主要的交互方式。

QOpenAI在2026年7月发布的新语音模型叫什么?它们的主要技术特点是什么?

AOpenAI在2026年7月发布了GPT-Live模型家族,包括GPT-Live-1和GPT-Live-1 mini。它们的主要技术特点是“全双工”通信能力,能够同时聆听和回应,消除了传统“一问一答”模式中的停顿,使对话更自然。

Q文章中提到,关于语音AI的快速发展,存在一个被投资者和开发者忽视但可能影响市场的监管风险是什么?

A文章中提到,被忽视的监管风险是“用户对界面‘人性化’的信任”。技术公司在竞相提高对话自然度时,可能面临监管要求,例如强制语音机器人在通话开始时即表明其非人类身份,这可能会影响技术接受度和市场发展。

QMicrosoft在2026年6月发布的语音合成模型MAI-Voice-2有哪些关键能力?

AMicrosoft在2026年6月发布的MAI-Voice-2是一个富有表现力的语音合成模型。它的关键能力包括:支持15种语言,并且能够控制语音输出中的情感色彩。

Q文章引用历史案例对当前语音AI热潮提出了什么警示?

A文章引用历史案例警示,当前的语音AI热潮可能重蹈早期Siri和Alexa等语音助手经历的“过高期望周期”的覆辙。那时,大规模应用并未实现预期的货币化收益。因此,当前这波以全双工模型为代表的技术浪潮,究竟是真正的范式转变,还是另一个相似周期,仍是一个悬而未决的问题。

你可能也喜歡

交易

現貨
活动图片