¡Acabando de ahora, Anthropic y OpenAI han lanzado simultáneamente una gran actualización en sus modos de voz!
Por parte de Claude, ha pasado de poder ejecutar solo Haiku a la serie completa Opus 4.8 y Sonnet 5, no solo puede integrarse con Gmail, Calendario, Slack en las conversaciones, sino que también amplía su soporte a 11 idiomas, pero sin chino.

Por parte de OpenAI, el GPT-Live full-duplex llega directamente al escritorio de macOS y Windows, con solo mover la boca puedes dirigir todo un equipo de Agentes al mismo tiempo, y además soporta chino.

Gran actualización de Claude Voice
Antes de esto, el modo de voz de Claude solo podía ejecutar Haiku, es decir, el modelo más pequeño.
Podías hablar con él por voz, entendía, pero con preguntas un poco más complejas era fácil que fallara.
Ahora, Opus 4.8 y Sonnet 5 ya están disponibles.
Puedes cambiar de modelo a mitad de la conversación. El sistema llama automáticamente a la versión más rápida del modelo seleccionado. Ojo, es la versión más rápida, no la versión de razonamiento completa.

La buena noticia es que el modo de voz cargará por defecto el modelo que usaste en el último chat de texto, el contexto entre texto y voz no se interrumpe, puedes cambiar entre ellos sin problemas.
En cuanto a la interacción, hay dos modos: Hands-free (escucha continua y respuesta automática) y Push-to-talk (mantén pulsado para hablar, suelta para terminar).
Por supuesto, lo más importante debe ser la «invocación de herramientas».
En conversaciones de voz, Claude ahora puede conectarse directamente a tu Gmail, Google Calendar, Slack, Google Docs, Canva.
Di una frase, y él buscará correos, consultará el calendario, leerá documentos, enviará mensajes por ti.
Robert Bye, gerente de producto de Anthropic, dio algunos ejemplos:
· Ayúdame a resumir lo que me he perdido en Slack en las últimas horas.
· Envía un resumen del PRD del nuevo proyecto a Nick en Slack.
Terminas de hablar, y el trabajo está hecho.

Técnicamente, la invocación de herramientas en voz usa la misma arquitectura Connectors que el chat de texto, no es una versión reducida, y antes de cada invocación aún te pedirá permiso.
Todos los planes pueden usarlo, pero los usuarios gratuitos solo tienen Haiku más 1 conector, para Opus completo hay que pagar. El uso se deduce de la cuota regular, y desde hoy se despliega la prueba pública en todas las plataformas.
11 idiomas, sin chino
En cuanto a idiomas, el modo de voz de Claude ahora soporta 11 idiomas: inglés, francés, alemán, hindi, indonesio, italiano, japonés, coreano, portugués de Brasil, español latinoamericano, español europeo.
De principio a fin, no hay chino.
Para esta parte de los usuarios, aún tendrán que seguir escribiendo.

Y Claude no detecta automáticamente en qué idioma hablas.
Tienes que pedirle activamente que cambie, por ejemplo «por favor, háblame en japonés», o seleccionarlo manualmente en la configuración. Si no cambias, el predeterminado es inglés.
Es interesante que anteriormente algunos desarrolladores encontraron en el código de la app de Claude una lista de idiomas que incluía 18 lenguas, donde claramente aparecía chino.
Resulta que, de 18 idiomas pasó a 11, y el chino fue directamente eliminado.

ChatGPT Voice llega al escritorio
En comparación, la voz de ChatGPT ha cambiado completamente su arquitectura desde la base.
Usa el GPT-Live lanzado recientemente el 8 de julio, un modelo de voz full-duplex.
Lo que se llama full-duplex es que el modelo puede procesar simultáneamente el flujo de entrada y salida de audio, y tomar decisiones decenas de veces por segundo, sin necesidad de que termines de hablar para responder.
Por eso GPT-Live intercalará «ajá», «entiendo» mientras hablas, como si fuera una persona real escuchando.
Yendo un paso más allá, se basa en una arquitectura de dos capas.
En el frente hay un modelo de voz ligero y de baja latencia, responsable del diálogo en tiempo real, la gestión de turnos, la respuesta a interrupciones, todo lo que requiere reacción en milisegundos.
En el fondo está GPT-5.5, encargado del razonamiento complejo, búsqueda web, tareas de Agentes.
Cuando haces una pregunta que requiere pensamiento profundo, GPT-Live delega la tarea de forma asíncrona al GPT-5.5 de fondo, y luego continúa hablando contigo, y cuando el resultado esté listo, te lo informa.
OpenAI llama a esto «Razonamiento Delegado» (Delegated Reasoning).

Concretamente, OpenAI ha desacoplado completamente la latencia de la conversación y la profundidad del razonamiento. No necesitas esperar a que el modelo grande termine de pensar para seguir hablando.
La profundidad de razonamiento también se puede ajustar en tres niveles: Instant el más rápido, Medium razonamiento medio, High razonamiento profundo, correspondiendo respectivamente a diferentes niveles de GPT-5.5. Los usuarios gratuitos usan GPT-Live-1 mini.
Según los resultados, esta arquitectura de delegación realmente funciona, el modo de voz finalmente deja de ser «un chat degradado».
GPQA (razonamiento científico a nivel experto) pasó del 45.3% al 84.2% desde el modo de voz avanzado anterior.
BrowseComp (capacidad de búsqueda web de Agentes) subió del 0.7% al 75.2%.
En el benchmark τ3-Voice Telecom que simula escenarios reales de múltiples turnos en servicio de telecomunicaciones, GPT-Live también supera ampliamente.



Hablando con la boca, múltiples Agentes funcionando simultáneamente
Con esta base, OpenAI lo ha llevado directamente al escritorio.
A partir de hoy, ChatGPT Voice llega oficialmente a la versión de escritorio de macOS y Windows.
Puedes configurar un atajo de teclado global para invocar ChatGPT Voice con una tecla en cualquier aplicación.
En macOS también hay una función Appshots, ChatGPT puede leer directamente el contenido de la ventana activa actual, usándolo como contexto de la conversación.
Por ejemplo, al hablarle a Excel diciendo «ayúdame a calcular el interanual del Q3», puede ver tu tabla.

Además, puedes usar la voz para dirigir a múltiples Agentes trabajando simultáneamente en ChatGPT Work y Codex.
Puedes hacer que un Agente escriba código, mientras otro busca documentos, solo hablando.
GPT-Live te habla en primer plano, mientras en segundo plano inicia, revisa, cambia múltiples hilos de trabajo, sin que necesites volver al teclado.
Actualmente, disponible para planes Plus, Pro, Business, Edu, Enterprise.
La diferencia que se nota en 10 segundos
¿Se puede interrumpir?
La voz de Claude es por turnos, piensa solo cuando terminas de hablar. ¿Quieres interrumpir? Espera.
GPT-Live puede ser interrumpido. Si cambias de idea a mitad de frase, se detiene inmediatamente y sigue tu nuevo pensamiento. Recuerda dónde estabas antes de la interrupción.
¿Puede hacer múltiples tareas a la vez?
Claude hace solo una cosa a la vez: chat de voz.
ChatGPT Voice en escritorio puede hablar contigo mientras en segundo plano controla la computadora, dirige múltiples Agentes para que cada uno haga su trabajo.
«Ayúdame a abrir un PR, y al mismo tiempo revisa los registros de CI de ayer», las dos cosas pueden empezar a ejecutarse simultáneamente.
¿Puede manipular?
La voz de Claude puede invocar herramientas SaaS como Gmail o Calendario a través de conectores, pero no toca tu escritorio.
ChatGPT Voice en escritorio, junto con Computer Use, puede manipular directamente tu computadora. Archivos, programas, terminal, todo lo puede tocar.
¿Qué tan profundo piensa?
La carta fuerte de Claude es Opus 4.8, aún es uno de los modelos más fuertes en tareas de razonamiento de múltiples pasos y síntesis de conocimiento. Pero el modo de voz ejecuta la versión más rápida de Opus, no la versión de razonamiento completa.
Por parte de GPT-Live, el nivel High puede delegar asíncronamente a GPT-5.5 Thinking para razonamiento profundo, por lo que en escenarios de voz puede invocar capacidades de razonamiento casi completas.

La era donde ni siquiera se necesita el cuadro de entrada
Viendo esto, la bifurcación de las dos empresas queda clara.
Claude, con su sistema por turnos, se enfoca en usar tu propio Gmail, calendario, documentos, para ayudarte a organizar tus asuntos.
GPT-Live, full-duplex, se enfoca en sentirse como hablar con una persona. Se puede interrumpir, multitarea, controlar la computadora, haciendo que olvides que al otro lado hay una IA.
Para quienes no programan, el umbral de Claude es mucho más bajo, si tienes correos que organizar, agendas que planificar, solo abre la boca.
El camino de OpenAI es más emocionante y más geek, primero debes tener realmente un equipo de Agentes, con trabajo real para que hagan.
Como dijo Greg Brockman, «Comparado con la voz, escribir es algo realmente antinatural.»
Esas teclas de plástico que han acompañado a la humanidad durante cuarenta años, hoy han sido oficialmente acorraladas por OpenAI y Anthropic simultáneamente.

Referencias:
https://x.com/testingcatalog/status/2080401533728940372
https://x.com/OpenAI/status/2080378182469857576
https://x.com/testingcatalog/status/2080385285951521150
https://x.com/claudeai/status/2080376094939603366
https://claude.com/blog/think-through-hard-problems-in-voice-mode
Este artículo proviene de la cuenta de WeChat pública "新智元" (New Zhiyuan), autor: ASI启示录, editor: Moisés





