Google, OpenAI y Microsoft están invirtiendo activamente en tecnologías que permiten comunicarse con agentes de IA mediante la voz, apostando por un aumento en la popularidad de la comunicación oral con la IA en comparación con las consultas de texto. Esta dirección se denomina cada vez más IA de voz. El interés de los inversores se confirma con datos de PitchBook, que cita Financial Times: las startups en el ámbito de la IA de voz recaudaron alrededor de $7 mil millones en el primer trimestre de 2026, siete veces más que en el mismo período de 2025.
El cálculo se basa en que el habla gradualmente desplazará a la entrada de texto como la principal forma de comunicarse con la IA. Las cifras de los principales actores del mercado lo confirman.
Google registra un aumento en las consultas por voz y visuales
Según Google, el número de consultas en modo AI Mode se ha más que duplicado cada trimestre desde el lanzamiento del servicio y hasta abril-mayo de 2026. En EE.UU., la voz o las imágenes ahora se utilizan en más de una de cada seis consultas de búsqueda, y el número de consultas con imágenes crece más del 40% mensual. La empresa vincula esta dinámica con que los usuarios eligen cada vez más un formato de comunicación cercano al habla natural, en lugar de escribir texto.
La apuesta de OpenAI por la voz
De los aproximadamente 900 millones de usuarios activos semanales de ChatGPT -cifra que la empresa anunció a finales de febrero de 2026-, más de 150 millones de personas usan cada semana la voz y la dictación para comunicarse con el servicio.
El 8 de julio de 2026, OpenAI lanzó la familia de modelos GPT-Live: GPT-Live-1 y la versión ligera GPT-Live-1 mini. Son modelos full-duplex, capaces de escuchar y responder al interlocutor simultáneamente, sin la pausa habitual de "consulta-respuesta". Precisamente ellos forman la base de la actualización de ChatGPT Voice.
Además del software, OpenAI también prepara un dispositivo por separado. Según fuentes de Bloomberg, la empresa está desarrollando un altavoz inteligente sin pantalla con cámara y sensores basado en GPT-Live. Un anuncio podría darse aún en 2026, y se espera su llegada al mercado a principios de 2027.
Microsoft desarrolla la síntesis de voz expresiva
Microsoft presentó en junio de 2026 el modelo MAI-Voice-2, un sintetizador de voz expresivo con soporte para 15 idiomas y control de la coloración emocional de la voz. La tecnología ya se está integrando en los productos de la empresa, incluidos Dynamics 365 Contact Center y Azure Voice Live.
Entre las principales áreas donde las empresas apuestan por la IA de voz se encuentran:
-
búsqueda y trabajo con agentes de IA mediante voz e imágenes
-
modelos de voz full-duplex para un diálogo más natural
-
dispositivos de hardware independientes para la interacción por voz
-
síntesis de voz con control de emociones para servicios corporativos
El aumento de las inversiones y los anuncios simultáneos de Google, OpenAI y Microsoft muestran que las interfaces de voz están pasando de ser funciones experimentales a una dirección independiente de desarrollo de productos de IA. Una mayor difusión de estas tecnologías dependerá de la rapidez con la que los usuarios adopten las nuevas formas de interacción en escenarios cotidianos.
Opinión de la IA
Desde el punto de vista de la dinámica regulatoria, el auge de la IA de voz conlleva un riesgo que inversores y desarrolladores han pasado por alto: la confianza del usuario en la "humanidad" de la interfaz. Mientras Google, OpenAI y Microsoft compiten en la naturalidad del diálogo, diputados de la Duma Estatal ya han enviado a la FAS una propuesta para obligar a los robots de voz a revelar su naturaleza desde los primeros segundos de la llamada. La brecha entre la carrera tecnológica por el "efecto de presencia" y los intentos de los reguladores por preservar el límite entre humano y máquina podría convertirse en un factor tan significativo para el mercado como el volumen de inversiones.
El patrón histórico sugiere precaución: los asistentes de voz ya han experimentado un ciclo de expectativas exageradas durante las primeras versiones de Siri y Alexa, cuando la adopción masiva no cumplió con las proyecciones de monetización. La pregunta sigue abierta: ¿resultará la actual ola de modelos full-duplex en un cambio real en la percepción de la tecnología o será otro giro del mismo ciclo?





