Del texto a la voz: Google, OpenAI y Microsoft invierten miles de millones en la comunicación hablada con IA

cryptonews.ruPublicado a 2026-08-07Actualizado a 2026-08-07

Resumen

Del texto a la voz: Google, OpenAI y Microsoft invierten miles de millones en la comunicación oral con IA. Google, OpenAI y Microsoft están invirtiendo fuertemente en tecnologías de comunicación por voz con IA, apostando a que esta forma de interacción supere a las consultas de texto. Las startups de IA de voz captaron unos 7.000 millones de dólares en el primer trimestre de 2026, siete veces más que en 2025. Google reporta que más de una de cada seis búsquedas en EE.UU. ya utiliza voz o imágenes, con un crecimiento mensual superior al 40% en consultas visuales. OpenAI anunció que más de 150 millones de usuarios semanales de ChatGPT emplean funciones de voz. La compañía lanzó sus modelos GPT-Live, que permiten conversaciones full-duplex (sin pausas), y está desarrollando un altavoz inteligente sin pantalla. Por su parte, Microsoft presentó MAI-Voice-2, un sintetizador de voz expresivo con control emocional para 15 idiomas. Los focos principales son: búsqueda por voz/imagen, modelos de diálogo full-duplex más naturales, dispositivos de hardware dedicados y síntesis de voz con emociones para servicios empresariales. La opinión de IA señala riesgos regulatorios, como la posible obligación de que los asistentes revelen su naturaleza artificial de inmediato, y cuestiona si esta nueva ola de tecnología representa un avance real o un ciclo repetido de expectativas exageradas.

Google, OpenAI y Microsoft están invirtiendo activamente en tecnologías que permiten comunicarse con agentes de IA mediante la voz, apostando por un aumento en la popularidad de la comunicación oral con la IA en comparación con las consultas de texto. Esta dirección se denomina cada vez más IA de voz. El interés de los inversores se confirma con datos de PitchBook, que cita Financial Times: las startups en el ámbito de la IA de voz recaudaron alrededor de $7 mil millones en el primer trimestre de 2026, siete veces más que en el mismo período de 2025.

El cálculo se basa en que el habla gradualmente desplazará a la entrada de texto como la principal forma de comunicarse con la IA. Las cifras de los principales actores del mercado lo confirman.

Google registra un aumento en las consultas por voz y visuales

Según Google, el número de consultas en modo AI Mode se ha más que duplicado cada trimestre desde el lanzamiento del servicio y hasta abril-mayo de 2026. En EE.UU., la voz o las imágenes ahora se utilizan en más de una de cada seis consultas de búsqueda, y el número de consultas con imágenes crece más del 40% mensual. La empresa vincula esta dinámica con que los usuarios eligen cada vez más un formato de comunicación cercano al habla natural, en lugar de escribir texto.

La apuesta de OpenAI por la voz

De los aproximadamente 900 millones de usuarios activos semanales de ChatGPT -cifra que la empresa anunció a finales de febrero de 2026-, más de 150 millones de personas usan cada semana la voz y la dictación para comunicarse con el servicio.

El 8 de julio de 2026, OpenAI lanzó la familia de modelos GPT-Live: GPT-Live-1 y la versión ligera GPT-Live-1 mini. Son modelos full-duplex, capaces de escuchar y responder al interlocutor simultáneamente, sin la pausa habitual de "consulta-respuesta". Precisamente ellos forman la base de la actualización de ChatGPT Voice.

Además del software, OpenAI también prepara un dispositivo por separado. Según fuentes de Bloomberg, la empresa está desarrollando un altavoz inteligente sin pantalla con cámara y sensores basado en GPT-Live. Un anuncio podría darse aún en 2026, y se espera su llegada al mercado a principios de 2027.

Microsoft desarrolla la síntesis de voz expresiva

Microsoft presentó en junio de 2026 el modelo MAI-Voice-2, un sintetizador de voz expresivo con soporte para 15 idiomas y control de la coloración emocional de la voz. La tecnología ya se está integrando en los productos de la empresa, incluidos Dynamics 365 Contact Center y Azure Voice Live.

Entre las principales áreas donde las empresas apuestan por la IA de voz se encuentran:

  • búsqueda y trabajo con agentes de IA mediante voz e imágenes

  • modelos de voz full-duplex para un diálogo más natural

  • dispositivos de hardware independientes para la interacción por voz

  • síntesis de voz con control de emociones para servicios corporativos

El aumento de las inversiones y los anuncios simultáneos de Google, OpenAI y Microsoft muestran que las interfaces de voz están pasando de ser funciones experimentales a una dirección independiente de desarrollo de productos de IA. Una mayor difusión de estas tecnologías dependerá de la rapidez con la que los usuarios adopten las nuevas formas de interacción en escenarios cotidianos.

Opinión de la IA

Desde el punto de vista de la dinámica regulatoria, el auge de la IA de voz conlleva un riesgo que inversores y desarrolladores han pasado por alto: la confianza del usuario en la "humanidad" de la interfaz. Mientras Google, OpenAI y Microsoft compiten en la naturalidad del diálogo, diputados de la Duma Estatal ya han enviado a la FAS una propuesta para obligar a los robots de voz a revelar su naturaleza desde los primeros segundos de la llamada. La brecha entre la carrera tecnológica por el "efecto de presencia" y los intentos de los reguladores por preservar el límite entre humano y máquina podría convertirse en un factor tan significativo para el mercado como el volumen de inversiones.

El patrón histórico sugiere precaución: los asistentes de voz ya han experimentado un ciclo de expectativas exageradas durante las primeras versiones de Siri y Alexa, cuando la adopción masiva no cumplió con las proyecciones de monetización. La pregunta sigue abierta: ¿resultará la actual ola de modelos full-duplex en un cambio real en la percepción de la tecnología o será otro giro del mismo ciclo?

Preguntas relacionadas

Q¿En qué están invirtiendo activamente Google, OpenAI y Microsoft según el artículo?

AEstán invirtiendo en tecnologías que permiten comunicarse con agentes de IA a través de la voz, apostando por el crecimiento de la comunicación oral con IA frente a las consultas de texto, un área conocida como IA de voz.

Q¿Qué datos de PitchBook, citados por Financial Times, destacan el interés inversor en la IA de voz?

ALas startups del sector de IA de voz captaron aproximadamente 7 mil millones de dólares en el primer trimestre de 2026, siete veces más que en el mismo período de 2025.

Q¿Qué innovación presentó OpenAI el 8 de julio de 2026 y qué característica clave tiene?

AOpenAI lanzó la familia de modelos GPT-Live (GPT-Live-1 y GPT-Live-1 mini). Son modelos full-duplex capaces de escuchar y responder simultáneamente, eliminando la pausa tradicional de 'consulta-respuesta'.

Q¿Qué modelo presentó Microsoft en junio de 2026 y cuál es una de sus capacidades principales?

AMicrosoft presentó el modelo MAI-Voice-2, un sintetizador de voz expresivo que admite 15 idiomas y permite controlar la carga emocional de la voz.

Q¿Qué riesgo regulatorio menciona el apartado 'Opinión de la IA' asociado al auge de la IA de voz?

AEl riesgo es la confianza del usuario en la 'humanidad' de la interfaz. Reguladores rusos ya han propuesto obligar a los robots de voz a revelar su naturaleza artificial desde los primeros segundos de una llamada, creando una posible brecha con la búsqueda tecnológica de naturalidad.

Lecturas Relacionadas

Trading

Spot
活动图片