ChatGPT Voice llega al escritorio: tú hablas, un grupo de IA se encarga de trabajar

marsbitPublicado a 2026-07-27Actualizado a 2026-07-27

Resumen

ChatGPT Voice ahora está disponible en la versión de escritorio, permitiendo a los usuarios controlar múltiples IA con comandos de voz. Según Andrej Karpathy, la entrada por voz facilita una transmisión de contexto de "alto ancho de banda" a la IA, que puede organizar pensamientos desordenados de manera más eficiente que la escritura. OpenAI ha integrado esta función en las modalidades Work y Codex de ChatGPT para macOS y Windows, con una implementación global en curso. El modelo subyacente, GPT-Live, permite interrupciones en tiempo real y puede gestionar tareas en segundo plano, coordinar múltiples agentes y acceder al contexto de proyectos, documentos y calendarios. Líderes de la industria como Musk y Altman respaldan el enfoque de voz, señalando que supera el cuello de botella de la escritura en términos de velocidad y riqueza contextual. Esta evolución transforma la interacción de "preguntar y responder" a "ordenar y ejecutar", posicionando a ChatGPT como un sistema operativo de trabajo impulsado por IA que permite a los usuarios delegar tareas complejas mediante comandos hablados.

Recientemente, Andrej Karpathy compartió su truco perezoso favorito: ¿qué hacer cuando quieres que una IA trabaje, pero no te apetece escribir cada detalle de la solicitud?

Él dijo: pues reclínate en la silla, cambia al modo de voz, deja fluir la corriente de conciencia y habla durante 10 minutos, aunque sea un desorden, como se te ocurra.

A veces empieza diciéndole a la IA: "He activado el reconocimiento de voz, no te preocupes por los errores ortográficos".

Lo sorprendente es que descubrió que la IA es especialmente buena para reconstruir estos monólogos largos y desordenados, y la versión que te devuelve a menudo es más clara que lo que tú mismo dijiste: ese lío de ideas enredadas en tu mente lo ha organizado ella, reduciendo también las veces que tienes que corregir o ajustar.

Esta es, precisamente, la forma en que Andrej Karpathy se siente más cómodo interactuando con la IA.

En sus propias palabras, esto puede mejorar la "fusión mental" entre la persona y el modelo. A menudo, a las personas les da pereza escribir palabra por palabra el contexto completo de algo. En ese caso, es mejor simplemente abrir la boca y soltar todo el lío de una vez.

El valor de la voz no está en liberar las manos, sino en proporcionar un contexto de alto ancho de banda a la IA.

Justo estos días, OpenAI ha llevado directamente esta forma de juego de "dirigir a la IA con la voz" al escritorio.

La versión de escritorio de ChatGPT ahora se puede controlar con la voz

El 23 de julio, OpenAI integró oficialmente ChatGPT Voice en los escenarios Work y Codex de la aplicación de escritorio.

A partir de ese día, se lanzó gradualmente a nivel global en macOS y Windows, cubriendo los niveles Plus, Pro, Business, Edu y Enterprise. Android lo tendrá próximamente, mientras que iOS podrá acceder de forma remota mediante emparejamiento (Remote).

Su base es el nuevo modelo de voz GPT-Live, lanzado el 8 de julio, que puede escuchar y hablar simultáneamente: puedes interrumpir en cualquier momento y él continuará desde tu última frase, dejando atrás el método antiguo y torpe de "grabar primero, luego transcribir, y luego responderte".

La clave es que esta vez la voz no es solo para charlar.

En Work y Codex, con solo abrir la boca puedes iniciar una tarea, preguntarle en qué punto está, ver el estado actual de algún agente inteligente, y también coordinar varios agentes en la misma conversación, para que cada uno haga lo suyo.

Mientras la tarea se ejecuta en segundo plano, puedes intercalar una orden para cambiar de rumbo; si se atasca o termina, te lo dirá activamente por voz, o te lo indicará en la pantalla.

Incluso puede continuar con el trabajo que tienes entre manos: accediendo al contexto del proyecto existente, conectándose a documentos, calendarios, contactos y registros de comunicación, para terminar algo que dejaste a medias.

La empresa también proporciona algunos ejemplos de la vida diaria: que revise tu calendario para ver si hay conflictos, que busque en el correo si ha habido cambios en un vuelo, que prepare las actas de una reunión... "mientras te tomas un café o te ocupas de otra cosa", estos trabajos se completan solos en segundo plano.

En macOS hay además funciones extra como Appshots y contexto de pantalla, que pueden leer directamente la ventana que tienes activa en primer plano, combinándolo con archivos locales y repositorios de código para comprender, y también se pueden personalizar las teclas de acceso rápido.

La actividad semanal combinada de Codex y ChatGPT Work ya ha superado los 10 millones.

En el vídeo promocional de OpenAI hay una escena muy interesante: varios ingenieros están en la misma habitación, frente a la misma sesión de escritorio, dando órdenes cada uno por su cuenta: una IA, y toda una sala de personas dándole instrucciones.

Esta es probablemente su idea de una "fiesta de programación colectiva".

OpenAI muestra en una escena doméstica cómo usar ChatGPT Voice: hablando las tareas que quieres hacer a la versión de escritorio de Codex, que continúa trabajando en segundo plano.

Escribir es un cuello de botella para la entrada de la IA, pero la voz no lo es

Por supuesto, esto no es una ocurrencia repentina solo de OpenAI.

Casi la misma semana, tres grandes nombres de la industria apostaron casi al unísono por la "voz".

Karpathy publicó en X diciendo que cuando hay demasiado contexto y no le apetece escribir, simplemente suelta un monólogo desordenado y deja que la IA lo organice.

Un fanático de Grok retuiteó la publicación de Karpathy, diciendo que ya está acostumbrado a usar la conversión de voz a texto de Grok, "ahora escribir me parece un suplicio", y aprovechó para criticar que la entrada por voz de Anthropic "es todavía bastante básica".

Musk retuiteó esto y añadió: Puedes usar Grok Build para asignar tareas a Grok como si hablaras con una persona.

Altman tampoco olvidó promocionar su nuevo modelo de voz GPT-Live.

Reveló que siempre ha preferido escribir a hablar con la IA, pero ahora con ChatGPT "ya hablo más de lo que escribo".

También destacó específicamente: cuando tienes un montón de contexto que volcar de una vez a la IA, la voz es lo más útil.

Lo que emociona a estos tres líderes no es simplemente "por fin poder usar la boca".

Detrás de esto se esconde esta lógica: a medida que los agentes se vuelven más potentes, las intenciones que debes proporcionarles también son más complejas, y el canal del teclado comienza a congestionarse:

Cuanto más escueto escribas, más pobre será la información que reciba el modelo.

Mientras que la salida por voz es un canal ancho por naturaleza: puedes explicar de un tirón las causas, consecuencias, preocupaciones y preferencias, aunque lo hagas de forma desordenada, el modelo puede manejarlo y luego organizar por ti ese flujo de conciencia.

En la comunidad ya hay quien ha comprobado empíricamente: el rendimiento del habla es de aproximadamente 240 palabras por minuto, mientras que escribir a máquina llega como máximo a 70-80 palabras por minuto, una diferencia de tres o cuatro veces.

GPT-Live delega el trabajo pesado de pensar a GPT-5.5 y GPT-5.6 en segundo plano, mientras que en primer plano solo se ocupa de mantener una conversación fluida contigo. Esta separación permite precisamente que la gente pueda hablar sin preocupaciones.

En resumen, las ideas en la mente humana son inherentemente paralelas y saltan de un tema a otro, pero el teclado te obliga a comprimirlas en líneas de texto.

Y la voz está haciendo que este muro ceda: está pasando de ser un "método de entrada perezoso" a una "entrada de contexto de alto ancho de banda".

En una frase: escribir es un cuello de botella para la entrada de la IA, pero la voz no lo es.

Detrás de la entrada por voz está "gestionar proyectos con la boca"

Lo que OpenAI ha integrado realmente en la versión de escritorio esta vez es permitir que la voz "gestione a la IA".

Según el FAQ oficial, en Work y Codex, con la voz puedes hacer esto: iniciar una tarea, establecer prioridades entre varias tareas, interrumpir a mitad de camino y cambiar de rumbo, mientras el trabajo continúa ejecutándose en segundo plano.

Yendo más allá, puede coordinar que varios agentes inteligentes trabajen juntos entre múltiples conversaciones y proyectos. Dices algo como "que A lo haga primero, que B espere, y que me avise cuando C tenga resultados", y en segundo plano se reorganiza en consecuencia.

También puede continuar el trabajo desde donde lo dejaste la última vez. Esto se basa en el contexto del proyecto, más las herramientas conectadas: tus documentos, calendario, contactos, registros de comunicación.

Si una tarea se atasca o termina, te lo hará saber mediante voz o un aviso en pantalla.

Esto ya no es el trabajo de un simple método de entrada por voz, se parece más a un centro de mando desde el que diriges un equipo de agentes inteligentes.

Aunque igualmente se trata de hablar con la IA, antes era para que la IA te entendiera a ti, ahora es para que la IA trabaje por ti.

Lo que ChatGPT aspira a ser es tu "sistema operativo de trabajo con IA"

Detrás de una función de voz se esconde una línea de desarrollo mayor: OpenAI quiere que ChatGPT sea tu "sistema operativo de trabajo con IA".

Estos últimos meses, OpenAI ha estado rediseñando la versión de escritorio de ChatGPT, integrando Chat, Work y Codex en una misma entrada, con cambio rápido entre ellos, ejecutándose de forma continua en segundo plano.

Codex también se ha ampliado hace tiempo para convertirse en una plataforma universal capaz de ejecutar múltiples agentes en paralelo, manejar tareas largas y comprender proyectos completos.

¿Por qué integrar estas capacidades en el escritorio, y no dejarlas en el teléfono móvil que todo el mundo usa?

Principalmente porque esa pequeña ventana de chat del teléfono no puede manejar trabajos complejos; es adecuada para preguntar algo rápidamente.

Para que la IA realmente se conecte a tus archivos, código y software, y lleve a cabo una tarea de principio a fin, necesita estar en tu ordenador:

El escritorio es donde están los archivos, el entorno de desarrollo integrado (IDE), el navegador, todo un conjunto de software empresarial; este es el campo de batalla principal de los agentes inteligentes.

Detrás de esto hay un cambio en la forma de interacción entre humanos e IA.

Antes usabas la IA "operando software": abrir, introducir, esperar, un turno tras otro.

Ahora te pareces más a un gerente con un equipo a su cargo: abres la boca para asignar tareas. Tu relación con la IA ha pasado silenciosamente de "tú preguntas, ella responde" a "tú dices, ella hace".

Un usuario muy activo llegó a decir que usar este sistema es "básicamente como tener a J.A.R.V.I.S.".

Incluso hizo que Codex le configurara un atajo de teclado para poder, con solo hablar, cambiar entre tres máquinas y varias pantallas.

Volviendo a la escena inicial, lo que realmente emociona a líderes como Musk, Altman y Karpathy no es poder deshacerse del teclado, sino que cuando la entrada ya no es un cuello de botella, las personas pueden devolver el esfuerzo mental ahorrado a lo que realmente merece la pena reflexionar: la toma de decisiones.

Así que la siguiente pregunta en realidad no es "si puedes hablar o no", sino cuando tienes ante ti una sala llena de IAs disponibles al instante, qué es exactamente lo que quieres que hagan por ti.

Referencias:

https://x.com/OpenAI/status/2080378182469857576

https://aihot.virxact.com/items/cmrxxi2qg03kcroxpcugdaldy

Este artículo proviene del WeChat Official Account "新智元" (Nueva Era de la Inteligencia), autor: ASI启示录

Preguntas relacionadas

Q¿Cuál es la nueva funcionalidad de ChatGPT Voice que OpenAI ha lanzado recientemente?

AOpenAI ha lanzado ChatGPT Voice para su aplicación de escritorio en macOS y Windows, integrada en los entornos Work y Codex. Permite usar comandos de voz para iniciar tareas, monitorear su progreso, coordinar múltiples agentes de IA en una misma conversación y cambiar la dirección de una tarea en curso, todo mientras la IA ejecuta las acciones en segundo plano.

QSegún Andrej Karpathy, ¿cuál es el principal beneficio de usar la entrada de voz para interactuar con IA en lugar de escribir?

AEl principal beneficio, según Andrej Karpathy, es que la voz permite transmitir un contexto de alto ancho de banda a la IA. En lugar de tener que escribir meticulosamente cada detalle, uno puede expresar sus pensamientos de manera desorganizada y fluida, y la IA es capaz de organizarlos y devolver una versión más clara y estructurada de las ideas.

Q¿En qué se diferencia el nuevo modelo de voz GPT-Live de los sistemas de voz tradicionales?

AGPT-Live, a diferencia de los sistemas de voz tradicionales que primero graban, luego transcriben y finalmente responden, puede escuchar y hablar simultáneamente. Esto permite al usuario interrumpir en cualquier momento y que la conversación fluya de forma natural, continuando desde el último punto hablado por el usuario.

Q¿Por qué OpenAI está enfocando estas capacidades de voz en la versión de escritorio y no en la móvil?

AOpenAI está enfocando estas capacidades en la versión de escritorio porque es el entorno donde los usuarios tienen acceso a archivos, entornos de desarrollo (IDE), navegadores y suites de software empresarial. Este es el campo de acción principal para que los agentes de IA realicen tareas complejas de principio a fin, algo que la pequeña ventana de chat de un teléfono móvil no puede manejar de manera efectiva.

QSegún el artículo, ¿cómo está evolucionando la relación entre humanos e IA con estas nuevas capacidades de voz?

ALa relación está evolucionando de un modelo de 'pregunta y respuesta' a uno de 'instrucción y ejecución'. El usuario actúa más como un gerente que delega tareas a un equipo de agentes de IA. La voz se convierte en una interfaz de alto ancho de banda para coordinar múltiples IA y proyectos, liberando al usuario de la carga de la entrada detallada por escrito para que pueda centrarse en la toma de decisiones.

Lecturas Relacionadas

Lido, el gigante del staking líquido, traslada 8 millones de ETH a nuevos validadores para aliviar la carga de la red Ethereum

El gigante de staking líquido Lido está trasladando 8 millones de ETH, valorados en unos 16.500 millones de dólares y que representan alrededor de una quinta parte de todo el ETH actualmente en staking, a nuevos validadores. Este movimiento, facilitado por la actualización Pectra de Ethereum a principios de año, permite consolidar miles de validadores antiguos (0x01) en muchos menos validadores nuevos (0x02), ya que cada uno puede ahora contener hasta 2.048 ETH en lugar de 32 ETH. Esta migración reducirá el número total de validadores de Ethereum en casi un tercio, lo que disminuirá la carga de datos en la capa de consenso y hará la red más eficiente y económica. Para Lido, aumentará la proporción de su ETH en validadores 0x02 del 32% actual a aproximadamente el 52%. La actualización, llamada Curated Module v2 (CMv2), también introduce un cambio clave: los operadores profesionales ahora deben bloquear ETH como garantía para cubrir riesgos como penalizaciones (slashing) o fallos operativos, alineándose con el módulo comunitario (CSM) existente. Además, el CSM v3 añade una nueva categoría para grupos comunitarios verificados que usan tecnología de validador distribuido (DVT), lo que reduce el riesgo y los requisitos de garantía. Los titulares de stETH no necesitan realizar ninguna acción. Lido también anunció una fase posterior para 2027 que creará un mercado donde los operadores competirán en función de tarifas y rendimiento.

cryptonews.ruHace 12 min(s)

Lido, el gigante del staking líquido, traslada 8 millones de ETH a nuevos validadores para aliviar la carga de la red Ethereum

cryptonews.ruHace 12 min(s)

Crypto.com, respaldada por Citadel Securities, traslada XYO y XL1 a custodia regulada

Crypto.com, con el respaldo de Citadel Securities, integra los tokens XYO y XL1 en su servicio de custodia regulada, ofreciendo a instituciones e inversores adinerados un mecanismo seguro para almacenar, gestionar y negociar ambos activos sin necesidad de transferirlos previamente a un exchange. La custodia utiliza carteras MPC segregadas por cliente, gestionadas por una entidad a prueba de bancarrota, con claves protegidas mediante computación multipartita. Esto proporciona almacenamiento en frío, trazabilidad auditora y acceso a la liquidez institucional de Crypto.com, eliminando el paso operativo de mover fondos antes de operar. El presidente de Crypto.com, Eric Anziani, destacó que el acuerdo busca ofrecer seguridad y liquidez ininterrumpida, apoyando la expansión global del ecosistema XYO. Marcus Levin, cofundador de XYO, subrayó la importancia de una custodia corporativa para sus activos digitales mientras desarrollan infraestructuras de IA y robótica. El anuncio sigue a una inversión de 400 millones de dólares de Citadel Securities en Crypto.com y a la obtención de una licencia bancaria federal condicional por parte de la empresa en 2026. XYO opera una red DePIN con millones de nodos que generan datos del mundo real para IA y logística, mientras que XL1 gestiona transacciones y tarifas dentro de esa red. Para inversores institucionales, este acuerdo facilita la exposición a tokens de nicho al demostrar que cumplen con los mismos estándares regulatorios y de seguridad que los activos más establecidos.

cryptonews.ruHace 15 min(s)

Crypto.com, respaldada por Citadel Securities, traslada XYO y XL1 a custodia regulada

cryptonews.ruHace 15 min(s)

Faltan menos de dos semanas: comienza la cuenta regresiva del BIP-110 para Bitcoin, y el apoyo de los mineros crece gradualmente ante el momento decisivo

Quedan menos de dos semanas para el inicio de la ventana de señalización obligatoria del BIP-110 (fork temporal suave de datos reducidos) para Bitcoin, que se activará en el bloque 961.632, alrededor del 9 de agosto de 2026. Su objetivo es limitar datos en transacciones no financieras, como inscripciones Ordinals y grandes cargas OP_RETURN. Aunque el apoyo entre mineros ha crecido del 1% al 3%, esto aún es insuficiente. Los principales pools (Foundry, Antpool, ViaBTC, F2pool), que controlan la mayor parte del hashrate, se mantienen en contra. Solo el pool Ocean y pequeños operadores independientes señalan a favor. En cuanto a nodos, solo un 22% ejecuta la implementación de Bitcoin Knots que aplica la propuesta. El mecanismo es controvertido. Si al abrirse la ventana no hay apoyo mayoritario, los nodos que aplican el BIP-110 rechazarán los bloques sin la señal, creando potencialmente dos cadenas: una mayoritaria (sin cambios) y una minoritaria (más lenta). Esto recuerda al UASF de 2017. Foundry, un pool clave (~23-33% del hashrate), dejó la decisión a una votación ponderada entre sus clientes; si no hay mayoría a favor, seguirá en contra. Los próximos días serán decisivos, dependiendo de si algún gran pool cambia de postura, las aclaraciones de los exchanges y las acciones reales de los mineros tras el bloque 961.632.

cryptonews.ruHace 15 min(s)

Faltan menos de dos semanas: comienza la cuenta regresiva del BIP-110 para Bitcoin, y el apoyo de los mineros crece gradualmente ante el momento decisivo

cryptonews.ruHace 15 min(s)

Trading

Spot
活动图片