谷歌、OpenAI和微软正积极投资于允许人们通过语音与AI助手交流的技术,押注AI语音交互相比文本查询的普及度将持续增长。这个方向越来越多地被称为“语音AI”。PitchBook提供给英国《金融时报》的数据证实了投资者的兴趣:2026年第一季度,语音AI领域的初创公司吸引了约70亿美元融资,是2025年同期融资额的七倍。
各大公司预期,口语将逐渐取代文本输入,成为与AI交流的主要方式。主要市场参与者的数据印证了这一趋势。
谷歌记录到语音与视觉查询的增长
根据谷歌的数据,自AI Mode服务推出以来,直至2026年4月至5月,其查询量每个季度都增长超过一倍。在美国,如今每六次搜索查询中就有超过一次使用语音或图像,而通过图片发起的查询数量每月增长超过40%。该公司将这一动态归因于用户越来越多地选择接近自然语言的交流形式,而非打字输入。
OpenAI的语音战略
在约9亿的ChatGPT周活跃用户中——这个数字是该公司在2026年2月底公布的——每周有超过1.5亿人使用语音和听写功能与服务交流。
2026年7月8日,OpenAI推出了GPT-Live系列模型:GPT-Live-1和轻量级的GPT-Live-1 mini。这些是全双工模型,能够同时聆听对话者并作出回应,无需经历传统的“请求-响应”停顿。它们构成了更新版ChatGPT Voice的基础。
除了软件部分,OpenAI还在准备独立的硬件设备。据彭博社消息人士透露,该公司正在开发一款基于GPT-Live的无屏幕智能音箱,配备摄像头和传感器。可能在2026年内发布公告,预计于2027年初上市。
微软开发富有表现力的语音合成技术
微软于2026年6月推出了MAI-Voice-2模型——这是一个富有表现力的语音合成器,支持15种语言,并能控制语音的情感色彩。该技术已开始集成到公司的产品中,包括Dynamics 365 Contact Center和Azure Voice Live。
各公司在语音AI领域的主要战略方向包括:
-
通过口语和图像进行搜索以及与AI助手交互
-
全双工语音模型,实现更自然的对话
-
用于语音交互的独立硬件设备
-
具有情感控制的企业级语音合成服务
投资的增长以及谷歌、OpenAI和微软几乎同步的产品发布表明,语音界面正在从实验性功能范畴,转变为AI产品发展的一个独立方向。此类技术的进一步普及将取决于用户在日常生活场景中适应新交互方式的速度。
AI观点
从监管动态来看,语音AI的繁荣蕴含着投资方和开发者可能忽视的风险:用户对界面“拟人程度”的信任度。当谷歌、OpenAI和微软竞相提升对话的自然度时,俄罗斯国家杜马的议员们已向联邦反垄断局提交提案,要求语音机器人在通话一开始就必须披露其非人类本质。这种在追求“临场感”的技术竞赛与监管机构试图维系人机界限之间的裂痕,很可能成为与投资规模同等重要的市场因素。
历史经验提示我们需要保持谨慎:早在Siri和Alexa早期版本时代,语音助手就经历过期望过高的周期,当时的大规模采用并未兑现货币化预期。当前的这股全双工模型浪潮,究竟是技术认知的真正转变,还是同一周期的又一次轮回,这个问题仍有待解答。
end-content




