Google、OpenAI和微软正积极投资于允许用户通过语音与AI智能体交流的技术,押注语音交互相比文本输入将更受欢迎。这一领域正日益被称为语音AI。投资者的兴趣得到了PitchBook数据的证实,《金融时报》引述数据显示:2026年第一季度,语音AI领域的初创公司筹集了约70亿美元资金——是2025年同期的七倍。
行业的预期是,口语将逐渐取代文本输入,成为与AI交互的主要方式。主要市场参与者的表现也证实了这一趋势。
Google记录到语音和视觉搜索的增长
根据Google的数据,从该服务推出到2026年4月至5月期间,AI Mode模式下的搜索请求数量每季度增长超过一倍。在美国,如今每六个搜索请求中就有超过一个使用语音或图片,而基于图像的请求量每月增长超过40%。公司将这一动态归因于用户越来越倾向于选择接近自然语言的交流形式,而非打字。
OpenAI押注语音
根据OpenAI在2026年2月底公布的数据,在ChatGPT约9亿的周活跃用户中,每周有超过1.5亿人使用语音和听写功能与服务交流。
2026年7月8日,OpenAI推出了GPT-Live系列模型:GPT-Live-1和轻量版GPT-Live-1 mini。这是全双工模型,能够同时聆听对话者并回应,无需传统的“请求-应答”停顿。它们构成了更新版ChatGPT Voice的基础。
除了软件部分,OpenAI还在准备独立的硬件设备。据彭博社消息人士称,该公司正在开发一款基于GPT-Live的无屏智能扬声器,配备摄像头和传感器。该产品可能在2026年内发布,预计在2027年初上市。
微软发展富有表现力的语音合成
微软于2026年6月发布了MAI-Voice-2模型——这是一个富有表现力的语音合成器,支持15种语言,并能控制声音的情感色彩。该技术已集成到公司的产品中,包括Dynamics 365 Contact Center和Azure Voice Live。
这些公司在语音AI领域重点押注的主要方向包括:
-
通过口语和图像进行搜索以及与AI智能体交互
-
用于更自然对话的全双工语音模型
-
专为语音交互设计的独立硬件设备
-
用于企业服务的可控情感语音合成
投资增长以及Google、OpenAI和微软相继发布产品表明,语音界面正从实验性功能类别转变为AI产品发展的一个独立方向。此类技术的进一步普及将取决于用户在日常生活场景中接受新交互方式的速度。
AI观点
从监管动态来看,语音AI的繁荣带来了投资者和开发者可能忽视的一个风险:用户对界面“拟人化”的信任度。当Google、OpenAI和微软在对话自然性上竞争时,俄罗斯国家杜马议员已向联邦反垄断局提交提案,要求语音机器人从通话一开始就揭示其非人本质。技术竞相追逐“临场感”效果,与监管机构试图维护人与机器界限的努力之间的裂痕,有可能成为与投资规模同等重要的市场因素。
历史模式提示需保持谨慎:早在Siri和Alexa早期版本的时代,语音助手就曾经历过期望过高的周期,当时的大规模应用并未兑现盈利预测。当前这一波全双工模型究竟会是技术认知的真正转变,还是同一周期的又一次循环,这个问题仍然悬而未决。
end-content




