ChatGPT voix débarque sur le bureau, vous n'avez qu'à parler, toute une équipe d'IA se charge du travail

marsbitPublié le 2026-07-27Dernière mise à jour le 2026-07-27

Résumé

ChatGPT Voice débarque sur le bureau : vous parlez, une équipe d'IA travaille. Andrej Karpathy a popularisé une méthode efficace : plutôt que de tout taper, il suffit de dicter ses besoins à l'IA de manière décousue pendant plusieurs minutes. Celle-ci excelle à réorganiser ce flux d'idées désordonné, fournissant souvent une version plus claire et structurée que l'expression originale. Cette approche améliore la « fusion mentale » entre l'humain et le modèle, la parole permettant un transfert riche de contexte. Suivant cette logique, OpenAI vient d'intégrer officiellement la fonctionnalité Voice à son application de bureau ChatGPT (Work et Codex) pour macOS et Windows. Basée sur le nouveau modèle vocal GPT-Live, elle permet une interaction fluide et interrompable. L'innovation clé est que la voix ne sert plus seulement à converser, mais aussi à piloter des tâches : lancer, prioriser, interrompre ou réorienter des travaux en cours d'exécution par des agents intelligents en arrière-plan. Le système peut coordonner plusieurs agents, utiliser le contexte des projets existants et se connecter à des outils (documents, calendrier, emails) pour compléter des tâches. Plusieurs figures de l'industrie, comme Sam Altman et Elon Musk, soulignent l'avantage décisif de la voix : son débit élevé (environ 240 mots/minute contre 70-80 en frappe) en fait un canal à large bande passante idéal pour transmettre des intentions complexes, brisant ainsi le goulot d'étranglement que constitue la sai...

Récemment, Andrej Karpathy a partagé une de ses astuces préférées pour les paresseux : que faire quand on veut que l'IA travaille, mais qu'on est trop fainéant pour taper clairement les instructions mot par mot ?

Il dit : il suffit de se renverser dans son fauteuil, de passer au mode vocal, de se lâcher totalement et de parler pendant 10 minutes, aussi désordonné et décousu que l'on veut.

Parfois, on commence même par prévenir l'IA : « Je passe en reconnaissance vocale, ne fais pas attention aux fautes de frappe ».

Curieusement, il a constaté que l'IA excelle à remettre en ordre ces longs bavardages désordonnés. La version qu'elle te renvoie est souvent plus claire que ce que tu as dit toi-même : les pensées embrouillées dans ton cerveau sont démêlées par elle, et les allers-retours pour rectifier le tir diminuent.

C'est justement la méthode qu'Andrej Karpathy préfère pour interagir avec l'IA.

Pour reprendre ses termes, cela améliore la « fusion mentale » entre l'homme et le modèle. Les gens sont souvent trop paresseux pour taper mot par mot le déroulement complet d'une chose, alors autant ouvrir la bouche et déverser d'un coup tout le foutoir.

La valeur de la voix ne réside pas dans la libération des mains, mais dans la transmission d'un contexte à haut débit vers l'IA.

Ces derniers jours, OpenAI a carrément importé cette façon de faire de « diriger l'IA à la parole » directement sur le bureau.

La version bureau de ChatGPT peut désormais être commandée à la voix

Le 23 juillet, OpenAI a officiellement intégré la fonction vocale (Voice) de ChatGPT dans les scénarios Work et Codex de l'application de bureau.

Le déploiement mondial a commencé ce jour-là par lots sur macOS et Windows, couvrant les formules Plus, Pro, Business, Edu et Enterprise. Android suivra bientôt, et iOS pourra s'y connecter à distance via Remote.

Son fondement est le nouveau modèle vocal GPT-Live, lancé le 8 juillet, capable d'écouter et de parler simultanément : tu peux interrompre à tout moment, il continue à partir de ta dernière phrase, au lieu de l'ancienne méthode lourde qui consistait à « enregistrer d'abord, transcrire ensuite, puis te répondre une phrase ».

L'essentiel est que cette fois, la voix ne sert pas seulement à bavarder.

Dans Work et Codex, en ouvrant simplement la bouche, tu peux lancer une tâche, lui demander où elle en est, vérifier l'état actuel d'un certain agent, et même coordonner plusieurs Agents dans une même conversation pour qu'ils travaillent chacun de leur côté.

La tâche tourne en arrière-plan, tu peux à tout moment intervenir pour changer de direction ; si elle est bloquée ou terminée, elle prendra la parole, ou t'enverra un rappel à l'écran.

Elle peut même enchaîner sur le travail en cours : utiliser le contexte existant du projet, se connecter aux documents, calendriers, contacts et historiques de communication pour terminer un travail à moitié fait.

L'équipe a également donné des exemples concrets de la vie quotidienne : lui demander de vérifier les conflits d'agenda, de fouiller dans les e-mails pour voir si un vol a été modifié, de préparer le compte-rendu d'une réunion... « Pendant que tu te fais un café ou que tu es occupé à autre chose », ces tâches s'exécutent toutes seules en arrière-plan.

Sur macOS, il y a en plus les fonctionnalités Appshots et le contexte de l'écran, qui peuvent lire directement la fenêtre actuellement active, en combinaison avec une compréhension des fichiers locaux et des dépôts de code, et les raccourcis clavier peuvent aussi être personnalisés.

L'activité hebdomadaire combinée de Codex et ChatGPT Work a déjà dépassé les 10 millions.

Dans la vidéo promotionnelle d'OpenAI, il y a une scène très intéressante : plusieurs ingénieurs se tiennent dans la même pièce, face à la même session de bureau, donnant chacun ses instructions : une seule IA, et une pièce entière de personnes lui donnant des ordres.

C'est probablement ainsi qu'ils imaginent la « fête de programmation collective ».

OpenAI démontre ChatGPT Voice dans une scène domestique : parler pour dire ce que l'on veut faire à Codex bureau, qui continue le travail en arrière-plan.

La frappe est un goulot d'étranglement pour l'entrée IA, mais pas la voix

Bien sûr, ce n'est pas un caprice isolé d'OpenAI.

Presque la même semaine, trois grands noms de l'industrie ont presque simultanément voté pour la « voix ».

Karpathy a posté sur X, disant que lorsqu'il y a trop de contexte et qu'il n'a pas envie de taper, il bavarde simplement de manière désordonnée et laisse l'IA organiser.

Un fan inconditionnel de Grok a partagé le post de Karpathy, disant qu'il utilisait depuis longtemps la fonction vocale de Grok, « maintenant, taper me semble être une torture », tout en critiquant au passage l'entrée vocale d'Anthropic comme étant « encore assez basique ».

Musk a retweeté ce message, ajoutant : tu peux, comme en parlant à une personne, utiliser Grok Build pour confier une tâche à Grok.

Altman n'a pas manqué de faire la promotion de son nouveau modèle vocal GPT-Live.

Il a avoué qu'il préférait toujours taper plutôt que parler à l'IA, mais qu'aujourd'hui, il « parle déjà plus qu'il ne tape » avec ChatGPT.

Il a particulièrement souligné : la voix est la plus utile quand tu as une énorme quantité de contexte à transmettre d'un coup à l'IA.

Ce qui enthousiasme ces trois grands noms, ce n'est en fait pas simplement « pouvoir enfin utiliser sa bouche ».

Derrière cela se cache une logique : plus les agents deviennent puissants, plus les intentions que tu dois leur donner deviennent complexes, et le canal du clavier commence à être saturé :

Plus tu tapes de manière concise, plus les informations que reçoit le modèle sont pauvres.

Alors que la sortie vocale est naturellement un canal large : tu peux d'un coup déverser toutes les causes et conséquences, préoccupations et préférences, même si c'est dit de manière désordonnée, le modèle peut le gérer, puis te démêler ce flux de conscience.

Dans la communauté, certains ont déjà testé en conditions réelles : le débit vocal est d'environ 240 mots par minute, tandis que la frappe atteint au maximum 70 à 80 mots, soit trois à quatre fois moins.

GPT-Live délègue les tâches lourdes au GPT-5.5 ou GPT-5.6 en arrière-plan pour réfléchir, tandis que l'avant-plan se contente de maintenir une conversation fluide pour t'accueillir. Cette dissociation vise précisément à permettre aux gens d'ouvrir la bouche sans contrainte.

En fin de compte, les idées dans le cerveau humain sont par nature parallèles et sautent d'un sujet à l'autre, mais le clavier te force à les comprimer en lignes de texte.

Et la voix fait céder ce mur : elle évolue d'un « outil de saisie paresseux » vers une « entrée de contexte à haut débit ».

En un mot, la frappe est un goulot d'étranglement pour l'entrée IA, mais pas la voix.

Derrière l'entrée vocale, se cache « la gestion de projet à la parole »

Ce qu'OpenAI a véritablement intégré cette fois dans la version bureau, c'est d'utiliser la voix pour « gérer l'IA ».

Selon la FAQ officielle, dans Work et Codex, en ouvrant la bouche, tu peux faire ces choses : lancer une tâche, prioriser plusieurs tâches, interrompre en cours de route, changer de direction, tandis que le travail continue à tourner en arrière-plan.

Plus loin, elle peut coordonner plusieurs agents intelligents pour qu'ils travaillent ensemble, à travers plusieurs conversations et projets. Tu dis « A fait d'abord, B attend, C m'appelle quand il a un résultat », et l'arrière-plan se réorganise en conséquence.

Elle peut aussi reprendre le travail là où il en était la fois précédente. Elle s'appuie pour cela sur le contexte du projet, ainsi que sur les outils connectés : tes documents, calendriers, contacts, historiques de communication.

Si une tâche est bloquée ou terminée, elle te le signale par la voix ou par une notification à l'écran.

Ce n'est plus le travail d'un simple outil de saisie vocale. Cela ressemble davantage à un centre nerveux depuis lequel tu orchestres une équipe d'agents intelligents.

Parler à l'IA en ouvrant la bouche, autrefois c'était pour qu'elle te comprenne, maintenant c'est pour qu'elle travaille à ta place.

Ce que ChatGPT veut devenir, c'est ton « système d'exploitation de travail IA »

Derrière une fonction vocale se cache une ambition plus large : OpenAI veut faire de ChatGPT ton « système d'exploitation de travail IA ».

Ces derniers mois, OpenAI a constamment retravaillé la version bureau de ChatGPT, regroupant Chat, Work et Codex dans une même interface, avec une bascule en un clic, tournant en permanence en arrière-plan.

Codex, lui aussi, s'est depuis longtemps élargi en une plateforme universelle capable d'exécuter plusieurs agents en parallèle, de gérer des tâches longues et de comprendre des projets entiers.

Pourquoi intégrer ces capacités sur le bureau, plutôt que de les laisser sur le téléphone que tout le monde utilise ?

C'est principalement parce que la petite fenêtre de discussion du téléphone ne peut pas gérer des tâches complexes, elle convient pour poser quelques questions à l'oral.

Pour vraiment permettre à l'IA de se connecter à tes fichiers, ton code et tes logiciels et de mener une tâche du début à la fin, elle doit résider dans ton ordinateur :

Le bureau, c'est là où se trouvent les fichiers, les environnements de développement intégrés (IDE), les navigateurs, toute la suite logicielle d'entreprise, c'est le champ de bataille principal des agents intelligents.

Derrière cela se cache un renversement de la manière dont les humains interagissent avec l'IA.

Avant, tu utilisais l'IA en « manipulant un logiciel » : ouvrir, saisir, attendre, un tour par un tour.

Maintenant, tu ressembles davantage à un manager avec une équipe : tu ouvres la bouche pour répartir les tâches, ta relation avec l'IA passe discrètement de « tu demandes, elle répond » à « tu dis, elle fait ».

Un utilisateur intensif a même déclaré que cette solution, une fois utilisée, « c'est essentiellement JARVIS ».

Il a même fait en sorte que Codex configure un raccourci clavier pour lui, pour qu'en parlant, il puisse basculer entre trois machines et plusieurs écrans.

Pour revenir à la scène du début, ce qui enthousiasme réellement les grands noms comme Musk, Altman, Karpathy et autres, ce n'est pas de pouvoir jeter le clavier, mais que lorsque la saisie n'est plus un goulot d'étranglement, l'homme peut consacrer l'énergie mentale ainsi économisée aux choses qui méritent vraiment d'être réfléchies : la prise de décision.

Donc la question suivante n'est en réalité pas « peux-tu ouvrir la bouche », mais plutôt : quand tu as devant toi une pièce pleine d'IA disponibles à tout instant, qu'est-ce que tu veux exactement qu'elles fassent à ta place.

Sources :

https://x.com/OpenAI/status/2080378182469857576

https://aihot.virxact.com/items/cmrxxi2qg03kcroxpcugdaldy

Cet article provient du compte WeChat public « Xin Zhi Yuan », auteur : ASI Revelation

Questions liées

QQuel est l'avantage principal de l'utilisation de la commande vocale avec ChatGPT, selon l'article ?

ALe principal avantage est de permettre un transfert de contexte à haut débit vers l'IA. L'article souligne que la valeur de la voix ne réside pas dans la libération des mains, mais dans la capacité à déverser une grande quantité d'informations contextuelles, même désorganisées, que le modèle peut ensuite organiser et clarifier.

QQuelles sont les deux nouvelles fonctionnalités de ChatGPT pour ordinateur mentionnées dans l'article ?

AL'article mentionne l'intégration de la fonctionnalité ChatGPT Voice (voix) dans les scénarios 'Work' (Travail) et 'Codex' de l'application de bureau. Cela permet de contrôler par la voix des tâches, de gérer plusieurs agents IA, et de reprendre le travail en cours en utilisant le contexte des projets et des outils connectés.

QQuel modèle vocal sous-tend cette nouvelle fonctionnalité de ChatGPT sur ordinateur ?

ACette nouvelle fonctionnalité vocale est basée sur le modèle GPT-Live, déployé le 8 juillet. Ce modèle peut écouter et parler simultanément, permettant à l'utilisateur d'interrompre la conversation, et fonctionne de manière plus fluide que l'ancienne méthode qui enregistrait, transcrivait, puis répondait.

QPourquoi OpenAI privilégie-t-il la version de bureau pour ces fonctionnalités avancées plutôt que l'application mobile ?

AL'application mobile, avec sa petite fenêtre de discussion, est plus adaptée pour poser des questions rapides. Le bureau est privilégié car c'est l'environnement principal de travail : il contient les fichiers, les IDE, les navigateurs et les suites logicielles d'entreprise. C'est là que les agents IA peuvent vraiment travailler sur des tâches complexes du début à la fin.

QComment l'article décrit-il l'évolution de la relation entre l'humain et l'IA avec ces nouvelles capacités ?

AL'article décrit une inversion de la manière d'interagir. Auparavant, l'utilisateur 'opérait un logiciel' en posant des questions et en attendant des réponses. Désormais, il devient plus comme un 'manager avec une équipe' : il assigne des tâches par la parole. La relation passe de 'vous interrogez, il répond' à 'vous dites, il fait'.

Lectures associées

Hong Kong prépare les banques aux menaces quantiques dans le cadre de l'essor de la tokenisation

L'Autorité monétaire de Hong Kong (HKMA) a publié un cadre pour évaluer la préparation des banques aux menaces posées par l'informatique quantique, alors que la ville développe l'utilisation des dépôts tokenisés, des actifs numériques et du règlement par blockchain. Un livre blanc et un premier Indice de Préparation Quantique (QPI) ont été introduits, attribuant au secteur un score de préparation de seulement 2,3 sur 10. Environ la moitié des institutions interrogées n'avaient aucun plan formel post-quantique. La HKMA vise un score maximal de 10 d'ici 2030. Cette initiative intervient dans un contexte de forte poussée vers la tokenisation à Hong Kong, avec notamment l'émission d'obligations vertes tokenisées et l'avancement du projet Ensemble pour les dépôts tokenisés. Le livre blanc souligne que les applications de registre distribué et les réseaux de paiement reposent sur la cryptographie, et pourraient être gravement perturbés si celle-ci était compromise par des ordinateurs quantiques capables de casser les algorithmes actuels comme RSA. La HKMA encourage donc les banques à commencer dès maintenant l'inventaire, l'évaluation des risques et la planification de la migration vers une cryptographie résistante au quantique, un processus qui peut prendre des années. Cette transition est cruciale pour sécuriser les signatures numériques, l'authentification et la confiance dans les systèmes financiers de plus en plus tokenisés.

cointelegraphIl y a 14 mins

Hong Kong prépare les banques aux menaces quantiques dans le cadre de l'essor de la tokenisation

cointelegraphIl y a 14 mins

Regard serein sur les lithographes chinois : 5 machines livrées, quelle distance nous sépare encore du défi lancé à ASML ?

L'auteur souligne qu'une entreprise d'État chinoise a commencé une production en petit lot d'un lithographe DUV par immersion, avec une livraison prévue de 5 machines en 2025 et un objectif de 20 unités pour 2027. Ces équipements, destinés à des fondeurs comme SMIC, visent une technologie de 28 nm. L'article nuance fortement l'optimisme de certains titres évoquant un "moment DeepSeek" pour la lithographie chinoise. Il rappelle que ces progrès concernent le DUV, une technologie antérieure à l'EUV, clé pour les nœuds avancés (5 nm, 3 nm). Bien que cruciale pour la sécurité de la chaîne d'approvisionnement, cette percée ne résout pas le défi de l'EUV, encore au stade de prototype. Les 5 machines prévues représentent un volume très faible face aux 130+ unités DUV par immersion vendues annuellement par ASML. L'accent est mis sur la nécessité de valider leur stabilité, leur débit et leur fiabilité en conditions réelles de production avant de conclure à un succès industriel. L'auteur conseille aux investisseurs de suivre des indicateurs concrets comme l'acceptation par les clients, les taux de disponibilité et l'émergence de commandes répétées. Il conclut que cette étape, bien que significative, marque un début de validation client plutôt qu'un bouleversement du marché mondial dominé par ASML.

marsbitIl y a 15 mins

Regard serein sur les lithographes chinois : 5 machines livrées, quelle distance nous sépare encore du défi lancé à ASML ?

marsbitIl y a 15 mins

Le gros coup de 800x, le « tirage de cartes » sauve le trading NFT

Le protocole Fake World Assets (FWA), lancé récemment sur Ethereum, connaît un succès fulgurant avec plus de 1,3 million de dollars de revenus en une semaine. Son token, $FWA, a vu sa valorisation multiplier par 800. Le protocole fonctionne comme une machine à sous (« loterie » ou « gacha ») pour NFT : les utilisateurs déposent des NFT et de l'ETH pour créer des pools. D'autres paient pour « tirer » un NFT au hasard. S'ils ne l'aiment pas, ils peuvent le revendre instantanément au déposant avec une décote de 15%, générant ainsi des revenus pour ce dernier. La particularité est que pour obtenir $FWA, il faut impérativement participer à ces tirages, créant une demande d'achat intégrée au jeu. La majorité des joueurs choisissent d'être payés en $FWA lors de la revente rapide, alimentant un cycle spéculatif où de nouveaux entrants font monter le prix pour les détenteurs existants. Ce mécanisme a propulsé FWA devant un projet similaire comme Collector Cards, dont le token a une utilité limitée. Cependant, l'article souligne que ce modèle dépend fortement de la hausse continue du prix de $FWA. Une fois que celle-ci s'arrête et que le coût des tirages n'est plus couvert par les gains potentiels, l'engouement risque de s'effondrer rapidement. La leçon est que la rentabilité seule est un narratif fragile en crypto ; l'attention et les mécanismes de transformation en demande d'achat sont des moteurs plus puissants à court terme.

marsbitIl y a 42 mins

Le gros coup de 800x, le « tirage de cartes » sauve le trading NFT

marsbitIl y a 42 mins

La menace de l'informatique quantique se rapproche, les cryptomonnaies pourraient être les premières exposées avant les banques

L'informatique quantique représente une menace potentielle pour tous les systèmes cryptographiques, des banques aux réseaux gouvernementaux. Toutefois, en raison de sa nature décentralisée et de son registre public, la cryptomonnaie pourrait être la première technologie réellement mise à l'épreuve, telle « un canari dans une mine de charbon ». Des experts estiment qu'un ordinateur quantique capable d'exécuter l'algorithme de Shor pour casser la cryptographie à courbe elliptique (comme ECDSA) pourrait apparaître vers 2029, une estimation avancée par des progrès récents en matériel et algorithmes. Le risque principal pour des blockchains comme Bitcoin ne réside pas tant dans la cryptographie elle-même, que dans la lenteur de leurs processus de gouvernance décentralisés. Contrairement aux institutions financières traditionnelles qui peuvent migrer rapidement vers des standards post-quantiques, les blockchains publiques nécessitent un large consensus parmi des millions de participants anonymes pour toute mise à niveau majeure. Des recherches montrent que même dans des conditions idéales, la migration sécurisée de toutes les transactions existantes (UTXO) nécessiterait au minimum 76 jours de traitement, sans compter le temps pour parvenir à un accord communautaire. Par ailleurs, la menace ne doit pas être vue comme un événement binaire (le « Q-Day »). Dès qu'un ordinateur quantique aura une capacité suffisante pour déchiffrer une clé privée avant que les actifs correspondants ne perdent leur valeur (en quelques mois plutôt qu'en temps réel), le risque devient concret. Environ un tiers des bitcoins, dont la clé publique est déjà exposée sur la chaîne, sont ainsi vulnérables à une « attaque statique ». La cryptomonnaie sert donc de système d'alerte précoce. Si elle venait à être compromise, elle révélerait une vulnérabilité partagée par l'ensemble des infrastructures financières mondiales, tout en mettant en lumière le défi que la décentralisation pose pour une adaptation coordonnée et rapide à une menace technologique existentielle.

marsbitIl y a 54 mins

La menace de l'informatique quantique se rapproche, les cryptomonnaies pourraient être les premières exposées avant les banques

marsbitIl y a 54 mins

Trading

Spot
活动图片