Acabando de ahora, Claude renueva completamente su voz, con 11 idiomas, pero sin chino

marsbitPublicado a 2026-07-24Actualizado a 2026-07-24

Resumen

Claude y OpenAI han actualizado simultáneamente sus modos de voz. Claude ahora admite los modelos Opus 4.8 y Sonnet 5 en su función de voz, permite cambiar entre ellos durante la conversación y se integra con herramientas como Gmail, Google Calendar y Slack. Sin embargo, solo soporta 11 idiomas, excluyendo el chino, y no detecta automáticamente el idioma del usuario. Su interacción es por turnos (hands-free o push-to-talk). Por otro lado, OpenAI ha lanzado GPT-Live, un modelo de voz full-duplex que permite interrupciones y respuestas en tiempo real. Utiliza una arquitectura de dos niveles: un modelo frontal para diálogo rápido y GPT-5.5 en segundo plano para tareas complejas. GPT-Live ya está disponible en escritorio (macOS y Windows), puede controlar el ordenador, gestionar múltiples agentes simultáneamente y sí incluye soporte para chino. En resumen, Claude se centra en la productividad personal con integraciones de SaaS, mientras que ChatGPT Voice busca una experiencia conversacional más natural y multitarea. Ambos avanzan hacia un futuro donde la voz reemplazará gradualmente la entrada de texto.

¡Acabando de ahora, Anthropic y OpenAI han lanzado simultáneamente una gran actualización en sus modos de voz!

Por parte de Claude, ha pasado de poder ejecutar solo Haiku a la serie completa Opus 4.8 y Sonnet 5, no solo puede integrarse con Gmail, Calendario, Slack en las conversaciones, sino que también amplía su soporte a 11 idiomas, pero sin chino.

Por parte de OpenAI, el GPT-Live full-duplex llega directamente al escritorio de macOS y Windows, con solo mover la boca puedes dirigir todo un equipo de Agentes al mismo tiempo, y además soporta chino.

Gran actualización de Claude Voice

Antes de esto, el modo de voz de Claude solo podía ejecutar Haiku, es decir, el modelo más pequeño.

Podías hablar con él por voz, entendía, pero con preguntas un poco más complejas era fácil que fallara.

Ahora, Opus 4.8 y Sonnet 5 ya están disponibles.

Puedes cambiar de modelo a mitad de la conversación. El sistema llama automáticamente a la versión más rápida del modelo seleccionado. Ojo, es la versión más rápida, no la versión de razonamiento completa.

La buena noticia es que el modo de voz cargará por defecto el modelo que usaste en el último chat de texto, el contexto entre texto y voz no se interrumpe, puedes cambiar entre ellos sin problemas.

En cuanto a la interacción, hay dos modos: Hands-free (escucha continua y respuesta automática) y Push-to-talk (mantén pulsado para hablar, suelta para terminar).

Por supuesto, lo más importante debe ser la «invocación de herramientas».

En conversaciones de voz, Claude ahora puede conectarse directamente a tu Gmail, Google Calendar, Slack, Google Docs, Canva.

Di una frase, y él buscará correos, consultará el calendario, leerá documentos, enviará mensajes por ti.

Robert Bye, gerente de producto de Anthropic, dio algunos ejemplos:

· Ayúdame a resumir lo que me he perdido en Slack en las últimas horas.

· Envía un resumen del PRD del nuevo proyecto a Nick en Slack.

Terminas de hablar, y el trabajo está hecho.

Técnicamente, la invocación de herramientas en voz usa la misma arquitectura Connectors que el chat de texto, no es una versión reducida, y antes de cada invocación aún te pedirá permiso.

Todos los planes pueden usarlo, pero los usuarios gratuitos solo tienen Haiku más 1 conector, para Opus completo hay que pagar. El uso se deduce de la cuota regular, y desde hoy se despliega la prueba pública en todas las plataformas.

11 idiomas, sin chino

En cuanto a idiomas, el modo de voz de Claude ahora soporta 11 idiomas: inglés, francés, alemán, hindi, indonesio, italiano, japonés, coreano, portugués de Brasil, español latinoamericano, español europeo.

De principio a fin, no hay chino.

Para esta parte de los usuarios, aún tendrán que seguir escribiendo.

Y Claude no detecta automáticamente en qué idioma hablas.

Tienes que pedirle activamente que cambie, por ejemplo «por favor, háblame en japonés», o seleccionarlo manualmente en la configuración. Si no cambias, el predeterminado es inglés.

Es interesante que anteriormente algunos desarrolladores encontraron en el código de la app de Claude una lista de idiomas que incluía 18 lenguas, donde claramente aparecía chino.

Resulta que, de 18 idiomas pasó a 11, y el chino fue directamente eliminado.

ChatGPT Voice llega al escritorio

En comparación, la voz de ChatGPT ha cambiado completamente su arquitectura desde la base.

Usa el GPT-Live lanzado recientemente el 8 de julio, un modelo de voz full-duplex.

Lo que se llama full-duplex es que el modelo puede procesar simultáneamente el flujo de entrada y salida de audio, y tomar decisiones decenas de veces por segundo, sin necesidad de que termines de hablar para responder.

Por eso GPT-Live intercalará «ajá», «entiendo» mientras hablas, como si fuera una persona real escuchando.

Yendo un paso más allá, se basa en una arquitectura de dos capas.

En el frente hay un modelo de voz ligero y de baja latencia, responsable del diálogo en tiempo real, la gestión de turnos, la respuesta a interrupciones, todo lo que requiere reacción en milisegundos.

En el fondo está GPT-5.5, encargado del razonamiento complejo, búsqueda web, tareas de Agentes.

Cuando haces una pregunta que requiere pensamiento profundo, GPT-Live delega la tarea de forma asíncrona al GPT-5.5 de fondo, y luego continúa hablando contigo, y cuando el resultado esté listo, te lo informa.

OpenAI llama a esto «Razonamiento Delegado» (Delegated Reasoning).

Concretamente, OpenAI ha desacoplado completamente la latencia de la conversación y la profundidad del razonamiento. No necesitas esperar a que el modelo grande termine de pensar para seguir hablando.

La profundidad de razonamiento también se puede ajustar en tres niveles: Instant el más rápido, Medium razonamiento medio, High razonamiento profundo, correspondiendo respectivamente a diferentes niveles de GPT-5.5. Los usuarios gratuitos usan GPT-Live-1 mini.

Según los resultados, esta arquitectura de delegación realmente funciona, el modo de voz finalmente deja de ser «un chat degradado».

GPQA (razonamiento científico a nivel experto) pasó del 45.3% al 84.2% desde el modo de voz avanzado anterior.

BrowseComp (capacidad de búsqueda web de Agentes) subió del 0.7% al 75.2%.

En el benchmark τ3-Voice Telecom que simula escenarios reales de múltiples turnos en servicio de telecomunicaciones, GPT-Live también supera ampliamente.

Hablando con la boca, múltiples Agentes funcionando simultáneamente

Con esta base, OpenAI lo ha llevado directamente al escritorio.

A partir de hoy, ChatGPT Voice llega oficialmente a la versión de escritorio de macOS y Windows.

Puedes configurar un atajo de teclado global para invocar ChatGPT Voice con una tecla en cualquier aplicación.

En macOS también hay una función Appshots, ChatGPT puede leer directamente el contenido de la ventana activa actual, usándolo como contexto de la conversación.

Por ejemplo, al hablarle a Excel diciendo «ayúdame a calcular el interanual del Q3», puede ver tu tabla.

Además, puedes usar la voz para dirigir a múltiples Agentes trabajando simultáneamente en ChatGPT Work y Codex.

Puedes hacer que un Agente escriba código, mientras otro busca documentos, solo hablando.

GPT-Live te habla en primer plano, mientras en segundo plano inicia, revisa, cambia múltiples hilos de trabajo, sin que necesites volver al teclado.

Actualmente, disponible para planes Plus, Pro, Business, Edu, Enterprise.

La diferencia que se nota en 10 segundos

¿Se puede interrumpir?

La voz de Claude es por turnos, piensa solo cuando terminas de hablar. ¿Quieres interrumpir? Espera.

GPT-Live puede ser interrumpido. Si cambias de idea a mitad de frase, se detiene inmediatamente y sigue tu nuevo pensamiento. Recuerda dónde estabas antes de la interrupción.

¿Puede hacer múltiples tareas a la vez?

Claude hace solo una cosa a la vez: chat de voz.

ChatGPT Voice en escritorio puede hablar contigo mientras en segundo plano controla la computadora, dirige múltiples Agentes para que cada uno haga su trabajo.

«Ayúdame a abrir un PR, y al mismo tiempo revisa los registros de CI de ayer», las dos cosas pueden empezar a ejecutarse simultáneamente.

¿Puede manipular?

La voz de Claude puede invocar herramientas SaaS como Gmail o Calendario a través de conectores, pero no toca tu escritorio.

ChatGPT Voice en escritorio, junto con Computer Use, puede manipular directamente tu computadora. Archivos, programas, terminal, todo lo puede tocar.

¿Qué tan profundo piensa?

La carta fuerte de Claude es Opus 4.8, aún es uno de los modelos más fuertes en tareas de razonamiento de múltiples pasos y síntesis de conocimiento. Pero el modo de voz ejecuta la versión más rápida de Opus, no la versión de razonamiento completa.

Por parte de GPT-Live, el nivel High puede delegar asíncronamente a GPT-5.5 Thinking para razonamiento profundo, por lo que en escenarios de voz puede invocar capacidades de razonamiento casi completas.

La era donde ni siquiera se necesita el cuadro de entrada

Viendo esto, la bifurcación de las dos empresas queda clara.

Claude, con su sistema por turnos, se enfoca en usar tu propio Gmail, calendario, documentos, para ayudarte a organizar tus asuntos.

GPT-Live, full-duplex, se enfoca en sentirse como hablar con una persona. Se puede interrumpir, multitarea, controlar la computadora, haciendo que olvides que al otro lado hay una IA.

Para quienes no programan, el umbral de Claude es mucho más bajo, si tienes correos que organizar, agendas que planificar, solo abre la boca.

El camino de OpenAI es más emocionante y más geek, primero debes tener realmente un equipo de Agentes, con trabajo real para que hagan.

Como dijo Greg Brockman, «Comparado con la voz, escribir es algo realmente antinatural.»

Esas teclas de plástico que han acompañado a la humanidad durante cuarenta años, hoy han sido oficialmente acorraladas por OpenAI y Anthropic simultáneamente.

Referencias:

https://x.com/testingcatalog/status/2080401533728940372

https://x.com/OpenAI/status/2080378182469857576

https://x.com/testingcatalog/status/2080385285951521150

https://x.com/claudeai/status/2080376094939603366

https://claude.com/blog/think-through-hard-problems-in-voice-mode

Este artículo proviene de la cuenta de WeChat pública "新智元" (New Zhiyuan), autor: ASI启示录, editor: Moisés

Preguntas relacionadas

Q¿Cuál es la principal diferencia en la funcionalidad de las nuevas actualizaciones de voz entre Claude y ChatGPT?

ALa principal diferencia es la arquitectura de funcionamiento de voz. Claude utiliza un modo por turnos, donde el usuario debe terminar de hablar para que la IA responda. En cambio, ChatGPT utiliza el modelo GPT-Live, que es dúplex completo, permitiendo respuestas en tiempo real y la capacidad de interrumpir la conversación, además de poder delegar tareas de razonamiento complejo a un modelo de fondo mientras mantiene la conversación.

Q¿Por qué Claude no incluye el chino entre sus 11 idiomas soportados en el modo de voz?

AAnthropic no ha proporcionado una razón oficial específica. El artículo menciona que una lista anterior encontrada en el código incluía 18 idiomas, entre ellos el chino, pero la versión final de 11 idiomas no lo contiene. Esto implica que fue excluido durante el desarrollo o priorización del lanzamiento, por lo que los usuarios chinos deben continuar utilizando el modo de texto por ahora.

Q¿Cómo maneja ChatGPT Voice la ejecución de múltiples tareas simultáneas?

AChatGPT Voice utiliza la arquitectura de GPT-Live, que le permite coordinar múltiples agentes (Agents) de forma simultánea. Mientras el usuario habla, el modelo puede iniciar, monitorear y cambiar entre diferentes hilos de trabajo en segundo plano. Esto permite, por ejemplo, que un agente escriba código mientras otro busca documentación, todo controlado por comandos de voz sin necesidad de usar el teclado.

Q¿Qué ventaja ofrece la integración de herramientas (Connectors) en el modo de voz de Claude?

ALa integración de Connectors permite que Claude interactúe directamente con aplicaciones externas como Gmail, Google Calendar, Slack, Google Docs y Canva mediante comandos de voz. El usuario puede pedirle que resuma correos electrónicos, consulte la agenda, envíe mensajes o lea documentos, y Claude ejecutará estas acciones tras solicitar permiso, integrando la voz en el flujo de trabajo personal o profesional del usuario.

QSegún el artículo, ¿cómo afectan estas actualizaciones al uso tradicional del teclado?

AEl artículo sugiere que estas actualizaciones de voz avanzadas, especialmente el enfoque dúplex completo y la capacidad de controlar múltiples tareas y el escritorio, están desafiando la necesidad del teclado. Cita a Greg Brockman de OpenAI diciendo que 'escribir es fundamentalmente antinatural'. La interacción por voz fluida y potente acerca la comunicación con la IA a una conversación humana, reduciendo la dependencia de la entrada de texto tradicional.

Lecturas Relacionadas

Fallo del caso de divorcio de Chey Tae-won: Revelando las líneas ocultas de sucesión detrás del imperio trillonario de SK Hynix

El caso de divorcio de Choi Tae-won, presidente de SK Group, concluyó con una sentencia histórica de división patrimonial. Este hecho pone bajo el foco la sucesión en el imperio de SK Hynix, cuyo valor se disparó un 700% alcanzando los 1.000 billones de wones. A diferencia del guion tradicional de los *chaebol* coreanos, centrado en el primogénito varón, los tres hijos de Choi Tae-won siguen trayectorias atípicas. La hija mayor, Choi Yoon-jung (1989), es considerada la candidata más visible. Con formación en biología y un doctorado, ocupa un puesto directivo en SK Bioscience y supervisa la estrategia de crecimiento del grupo. Se casó con el cofundador de una *startup* de IA. La segunda hija, Choi Min-jung (1991), forjó un camino único: sirvió como oficial en la Marina de Corea, trabajó en políticas globales para SK Hynix en Washington y ahora es fundadora de una empresa de salud con IA. Se casó con un ex oficial del Cuerpo de Marines de EE.UU. El hijo menor, Choi In-geun (1995), a pesar de ser el primogénito varón y seguir el patrón formativo típico (consultoría en McKinsey), permanece en un discreto silencio público sin un rol definido dentro del grupo. El divorcio de sus padres, Choi Tae-won y Roh Soh-yeong, hija del expresidente Roh Tae-woo, culminó en una batalla legal multimillonaria que involucró a los tres hijos, quienes presentaron peticiones judiciales no divulgadas. Mientras SK Hynix se convierte en un activo geopolítico global, la sucesión ya no es un asunto meramente familiar. Los herederos de la tercera generación no heredan simplemente una empresa, sino el complejo desafío de navegar la era de la IA, las políticas globales y encontrar nuevas fuentes de crecimiento, redefiniendo así el legado del *chaebol*.

marsbitAyer 09:13

Fallo del caso de divorcio de Chey Tae-won: Revelando las líneas ocultas de sucesión detrás del imperio trillonario de SK Hynix

marsbitAyer 09:13

¡En solo 2 meses su valoración ha pasado de 8.800 millones a 68.000 millones de euros! OpenRouter, la mayor centralita de la IA, podría ser adquirida

Stripe está en conversaciones para adquirir la startup de inteligencia artificial OpenRouter, el mayor mercado de modelos de IA que actúa como intermediario, por un monto cercano a los 100.000 millones de dólares. Esta valoración representa un aumento de casi siete veces respecto a los 13.000 millones de dólares de hace dos meses. La plataforma de OpenRouter permite a los desarrolladores acceder a más de 400 grandes modelos de lenguaje a través de una única API, optimizando automáticamente la selección del modelo según la complejidad de la tarea, el coste y la velocidad, similar a un comparador de precios. Fundada en 2023 por Alex Atallah (cofundador de OpenSea) y Louis Vichy, la empresa tiene un ingreso anualizado de 50 millones de dólares y más de un millón de desarrolladores usuarios. Para Stripe, líder mundial en pagos en línea, esta adquisición es un paso estratégico hacia la consolidación de su infraestructura para la economía de la IA, tras la compra reciente de Metronome, una plataforma de facturación por uso. El objetivo es ofrecer un paquete integral que gestione desde la selección de modelos y la facturación por tokens hasta los pagos, convirtiéndose en el centro de control para las aplicaciones de IA. Aunque la transacción aún podría fracasar, refleja la apuesta por el crecimiento explosivo del sector y el valor de controlar la capa de intermediación que decide cómo se distribuyen las consultas y los costes entre los distintos proveedores de modelos.

链捕手Ayer 09:04

¡En solo 2 meses su valoración ha pasado de 8.800 millones a 68.000 millones de euros! OpenRouter, la mayor centralita de la IA, podría ser adquirida

链捕手Ayer 09:04

Trading

Spot
活动图片