À l'instant, Claude a radicalement amélioré la voix, 11 langues, mais pas le chinois

marsbitPublié le 2026-07-24Dernière mise à jour le 2026-07-24

Résumé

Anthropic et OpenAI viennent de lancer des mises à jour majeures de leurs modes vocaux. **Claude** améliore son mode vocal : désormais compatible avec les modèles Opus 4.8 et Sonnet 5 (auparavant limité à Haiku). Il permet d'appeler des outils comme Gmail, Google Calendar, Slack, Google Docs et Canva par commande vocale pour gérer des tâches (résumer des e-mails, envoyer des messages, etc.). Onze langues sont supportées (anglais, français, japonais, etc.), **mais le chinois est absent**. L'utilisateur doit sélectionner manuellement la langue. Le système utilise la version la plus rapide des modèles, et non la version de raisonnement complète. De son côté, **OpenAI** introduit **GPT-Live**, un modèle vocal duplex intégral (traitement simultané de l'entrée et de la sortie audio) pour ChatGPT Voice. Il fonctionne avec une architecture à deux niveaux : un modèle vocal léger pour la conversation en temps réel et GPT-5.5 en arrière-plan pour le raisonnement complexe et les tâches d'agent. Cette approche permet des interruptions naturelles, une délégation de tâches et un contrôle vocal de plusieurs agents simultanément. GPT-Live est désormais disponible sur les applications de bureau macOS et Windows, avec prise en charge du chinois. En résumé, Claude se concentre sur l'intégration d'outils SaaS pour la productivité personnelle, tandis que ChatGPT Voice, avec GPT-Live, vise une interaction conversationnelle plus naturelle, polyvalente et capable de piloter l'ordinateur et plusieu...

À l'instant, Anthropic et OpenAI ont simultanément dévoilé des mises à jour majeures de leur mode vocal !

Du côté de Claude, on est passé du seul modèle Haiku à toute la gamme Opus 4.8 et Sonnet 5. Non seulement il peut maintenant piloter Gmail, Calendrier, Slack dans la conversation, mais il s'est aussi étendu à 11 langues, mais sans le chinois.

Du côté d'OpenAI, le GPT-Live full-duplex est directement disponible sur les bureaux macOS et Windows. Il suffit de parler pour commander toute une équipe d'Agents simultanément, et il prend en charge le chinois.

Grande mise à jour de Claude Voice

Auparavant, le mode vocal de Claude ne pouvait faire tourner que Haiku, le plus petit modèle.

Vous pouviez discuter avec lui vocalement, il comprenait, mais pour des questions un peu complexes, il avait tendance à déraper.

Maintenant, Opus 4.8 et Sonnet 5 sont disponibles.

Vous pouvez changer de modèle en cours de conversation. Le système appelle automatiquement la version la plus rapide du modèle sélectionné. Attention, c'est la version la plus rapide, pas la version de raisonnement complète.

La bonne nouvelle est que le mode vocal charge par défaut le modèle que vous avez utilisé lors de votre dernier chat écrit, le contexte est continu entre le texte et la voix, vous pouvez passer de l'un à l'autre sans interruption.

Pour l'interaction, il y a deux modes : Hands-free écoute en continu et répond automatiquement, Push-to-talk appuyez pour parler, relâchez pour terminer.

Bien sûr, le plus important, c'est l'« appel d'outils ».

Dans une conversation vocale, Claude peut maintenant se connecter directement à votre Gmail, Google Calendar, Slack, Google Docs, Canva.

Dites une phrase, il fouille vos emails, consulte votre agenda, lit des documents, envoie des messages à votre place.

Le product manager d'Anthropic, Robert Bye, a donné quelques exemples :

· Résume-moi ce que j'ai manqué sur Slack ces dernières heures.

· Envoie le résumé du nouveau PRD à Nick sur Slack.

Vous dites les choses, et le travail est fait.

Techniquement, l'appel d'outils vocal utilise la même architecture Connectors que le chat écrit, ce n'est pas une version limitée, et il demande votre autorisation avant chaque appel.

Tous les forfaits peuvent l'utiliser, mais les utilisateurs gratuits n'ont que Haiku avec 1 connecteur, pour la suite Opus complète, il faut payer. L'utilisation est déduite du quota habituel. Le déploiement public sur toutes les plateformes commence aujourd'hui.

11 langues, pas de chinois

Au niveau des langues, le mode vocal de Claude prend désormais en charge 11 langues : anglais, français, allemand, hindi, indonésien, italien, japonais, coréen, portugais brésilien, espagnol d'Amérique latine, espagnol d'Europe.

Regardez de la première à la dernière, pas de chinois.

Pour cette partie des utilisateurs, il faudra continuer à taper.

De plus, Claude ne détecte pas automatiquement la langue que vous parlez.

Vous devez lui demander explicitement de changer, par exemple « Parle-moi en japonais s'il te plaît », ou aller le sélectionner manuellement dans les paramètres. Si vous ne changez pas, c'est l'anglais par défaut.

Il est intéressant de noter que des développeurs avaient précédemment extrait d'une liste de langues dans le code de l'application Claude une liste de 18 langues, où Chinese était clairement indiqué.

Résultat, 18 langues sont devenues 11, le chinois a été purement et simplement supprimé.

ChatGPT Voice débarque sur le bureau

En comparaison, la voix de ChatGPT, elle, a changé complètement d'architecture à la base.

Elle utilise GPT-Live, un modèle vocal full-duplex publié le 8 juillet.

Full-duplex signifie que le modèle peut traiter simultanément les flux audio d'entrée et de sortie, et prendre des dizaines de décisions par seconde, pouvant répondre sans attendre que vous ayez fini de parler.

C'est pourquoi GPT-Live fait « hmm » « je vois » pendant que vous parlez, comme une personne réelle qui écoute.

Allant plus loin, il est basé sur une architecture à deux couches.

À l'avant-plan, un modèle vocal léger et à faible latence, responsable de la conversation en temps réel, de la gestion des tours de parole, des interruptions, tout ce qui nécessite une réaction en millisecondes.

À l'arrière-plan, c'est GPT-5.5 qui s'occupe du raisonnement complexe, de la recherche web, des tâches d'Agent.

Lorsque vous posez une question nécessitant une réflexion profonde, GPT-Live délègue la tâche de manière asynchrone au GPT-5.5 en arrière-plan, puis continue de discuter avec vous, et fait son rapport lorsque le résultat est prêt.

OpenAI appelle cela le « Raisonnement Délégué » (Delegated Reasoning).

Concrètement, OpenAI a complètement découplé la latence de la conversation et la profondeur du raisonnement. Vous n'avez pas besoin d'attendre que le grand modèle ait fini de réfléchir pour pouvoir continuer à parler.

La profondeur de raisonnement peut aussi être ajustée sur trois niveaux : Instant le plus rapide, Medium raisonnement moyen, High raisonnement profond, correspondant respectivement à différents niveaux de GPT-5.5. Les utilisateurs gratuits utilisent GPT-Live-1 mini.

D'après les benchmarks, cette architecture de délégation est vraiment efficace, le mode vocal n'est enfin plus une « version dégradée du chat ».

GPQA (raisonnement scientifique expert) est passé de 45,3 % à 84,2 % par rapport au précédent mode vocal avancé.

BrowseComp (capacité de recherche web par Agent) est passé de 0,7 % à 75,2 %.

Sur le benchmark τ3-Voice Telecom simulant un scénario réel de service client téléphonique multi-tours, GPT-Live surpasse aussi complètement la concurrence.

En parlant, plusieurs Agents tournent en même temps

Avec ces bases, OpenAI l'a directement déployé sur le bureau.

À partir d'aujourd'hui, ChatGPT Voice débarque officiellement sur les versions bureau de macOS et Windows.

Vous pouvez définir un raccourci clavier global pour invoquer ChatGPT Voice d'un seul geste dans n'importe quelle application.

Sur macOS, il y a aussi la fonction Appshots, ChatGPT peut lire directement le contenu de votre fenêtre active actuelle, pour l'utiliser comme contexte de conversation.

Par exemple, en parlant à Excel « aide-moi à calculer la croissance annuelle du T3 », il peut voir votre tableau.

De plus, vous pouvez utiliser la voix pour commander à plusieurs Agents de travailler simultanément dans ChatGPT Work et Codex.

Faites écrire du code à un Agent pendant qu'un autre recherche de la documentation, il suffit de le dire.

GPT-Live discute avec vous à l'avant-plan, tout en lançant, vérifiant, changeant plusieurs threads de travail en arrière-plan simultanément, sans que vous ayez besoin de revenir au clavier.

Actuellement, disponible pour les forfaits Plus, Pro, Business, Edu, Enterprise.

La différence se sent en 10 secondes

Peut-on interrompre ?

Claude vocal fonctionne en alternance, il réfléchit une fois que vous avez fini de parler. Vous voulez l'interrompre ? Attendez.

GPT-Live peut être interrompu. Vous changez d'avis au milieu d'une phrase, il s'arrête immédiatement et suit votre nouvelle idée. Il se souvient d'où vous en étiez avant l'interruption.

Peut-on faire plusieurs choses à la fois ?

Claude ne fait qu'une chose à la fois – discuter vocalement.

ChatGPT Voice sur le bureau peut à la fois vous parler et, en arrière-plan, manipuler l'ordinateur, commander à plusieurs Agents de travailler chacun de leur côté.

« Ouvre-moi une PR, et vérifie en même temps les logs CI d'hier », les deux tâches peuvent commencer à s'exécuter simultanément.

Peut-il agir directement ?

Claude vocal peut, via les connecteurs, appeler des outils SaaS comme Gmail, Calendrier, mais il n'a pas accès à votre bureau.

ChatGPT Voice sur le bureau, avec Computer Use, peut manipuler directement votre ordinateur. Fichiers, programmes, terminal, il peut tout toucher.

À quel point pense-t-il profondément ?

L'atout de Claude est Opus 4.8, qui reste l'un des modèles les plus puissants pour les tâches de raisonnement en plusieurs étapes et de synthèse des connaissances. Mais le mode vocal utilise la version la plus rapide d'Opus, pas la version de raisonnement à pleine puissance.

Du côté de GPT-Live, le niveau High peut déléguer de manière asynchrone à GPT-5.5 Thinking pour un raisonnement profond, ce qui permet en fait, dans un scénario vocal, d'utiliser une capacité de raisonnement proche de la pleine puissance.

L'ère où même la zone de saisie devient inutile

À ce stade, la bifurcation des deux entreprises est claire.

Claude, en alternance, se concentre sur l'utilisation de vos propres Gmail, calendrier, documents, pour vous aider à organiser vos propres affaires.

Le GPT-Live full-duplex se concentre sur la sensation de parler à une personne. Il peut être interrompu, gérer plusieurs threads, contrôler l'ordinateur, vous faisant oublier que c'est une IA en face.

Pour ceux qui ne codent pas, Claude est bien moins complexe, si vous avez des emails à trier, un emploi du temps à organiser, il suffit d'ouvrir la bouche.

La voie d'OpenAI est plus agréable et plus geek, il faut vraiment avoir une équipe d'Agents sous la main, de vrais travaux à leur confier.

Comme l'a dit Greg Brockman, « Comparée à la voix, taper est en soi une chose très peu naturelle. »

Ces touches en plastique qui ont accompagné l'humanité pendant quarante ans sont désormais officiellement poussées dans leurs derniers retranchements à la fois par OpenAI et Anthropic.

Références :

https://x.com/testingcatalog/status/2080401533728940372

https://x.com/OpenAI/status/2080378182469857576

https://x.com/testingcatalog/status/2080385285951521150

https://x.com/claudeai/status/2080376094939603366

https://claude.com/blog/think-through-hard-problems-in-voice-mode

Cet article provient du compte WeChat public « Xin Zhi Yuan », auteur : ASI Apocalypse, éditeur : Moïse

Questions liées

QQuelles sont les principales améliorations apportées au mode vocal de Claude par rapport à sa version précédente ?

ALe mode vocal de Claude a été mis à niveau pour prendre en charge les modèles Opus 4.8 et Sonnet 5, et non plus uniquement le modèle léger Haiku. Il permet désormais l'appel d'outils pour interagir avec Gmail, Google Calendar, Slack, Google Docs et Canva. Il prend également en charge 11 langues (mais pas le chinois) et propose deux modes d'interaction : 'Hands-free' (écoute continue) et 'Push-to-talk' (appuyer pour parler).

QComment fonctionne l'architecture GPT-Live de ChatGPT Voice et quels avantages offre-t-elle ?

AGPT-Live est un modèle vocal duplex intégral, basé sur une architecture à deux couches. Une couche frontale, légère et à faible latence, gère la conversation en temps réel, le tour de parole et les interruptions. Une couche arrière, utilisant GPT-5.5, effectue les raisonnements complexes, les recherches web et les tâches d'Agent. Cette architecture de 'raisonnement délégué' permet à l'utilisateur de continuer à parler pendant que le modèle réfléchit en arrière-plan, réduisant considérablement les délais de réponse.

QQuelles sont les différences majeures entre l'approche vocale de Claude et celle de ChatGPT ?

AClaude fonctionne en mode alterné (tour par tour) et se concentre sur l'intégration d'outils SaaS (comme Gmail, Slack) pour aider à la gestion des tâches personnelles. ChatGPT Voice, grâce à GPT-Live, est en duplex intégral, permet l'interruption, peut contrôler l'ordinateur de bureau et coordonner plusieurs Agents en parallèle. Claude ne détecte pas automatiquement la langue, tandis que ChatGPT supporte le chinois. Enfin, GPT-Live peut déléguer des tâches de raisonnement profond à GPT-5.5, tandis que le mode vocal de Claude utilise une version rapide, et non complète, de ses modèles.

QPourquoi l'absence du chinois dans la prise en charge linguistique de Claude est-elle notable ?

AL'absence du chinois est notable car il s'agit d'une langue majeure avec des centaines de millions de locuteurs. De plus, des développeurs avaient précédemment trouvé dans le code de l'application Claude une liste de 18 langues, incluant le chinois, mais la version finale n'en propose que 11, ayant exclu le chinois. Cette décision contraste avec ChatGPT Voice qui, lui, prend en charge le chinois.

QQuels sont les avantages spécifiques de ChatGPT Voice sur les versions de bureau (macOS/Windows) ?

ASur les versions de bureau, ChatGPT Voice offre un raccourci global pour l'invoquer depuis n'importe quelle application. Sous macOS, la fonction 'Appshots' permet à ChatGPT de lire le contenu de la fenêtre active comme contexte. Il peut directement contrôler l'ordinateur (fichiers, programmes, terminal) via Computer Use. Il permet également de commander vocalement plusieurs Agents (de ChatGPT Work et Codex) pour qu'ils travaillent simultanément sur différentes tâches en arrière-plan.

Lectures associées

L'affaire de divorce de Chey Tae-won finalisée : Révélations sur les lignes cachées de succession derrière le conglomérat de mille milliards de SK Hynix

L'affaire de divorce de Chey Tae-won, président du groupe SK, s'est conclue par un jugement historique, mettant en lumière les complexités successorales derrière le géant SK Hynix, dont la valorisation a dépassé 1 000 billions de wons. Contrairement aux scénarios traditionnels de succession des chaebols sud-coréens, qui privilégient l'aîné masculin, les trois enfants de Chey Tae-won suivent des trajectoires distinctes et modernes. L'aînée, Chey Yun-jeong, considérée comme la successeure la plus probable, occupe un poste de direction au sein de SK Inc. et dirige des projets stratégiques dans la biopharmacie, alliant formation scientifique et compétences en consulting. La seconde fille, Chey Min-jeong, ancienne officière de marine et ex-employée de SK Hynix aux États-Unis, a fondé une startup dans la santé numérique et épousé un ancien officier du Corps des Marines américain, incarnant les dimensions géopolitiques de l'industrie des semi-conducteurs. Le fils cadet, Chey In-geon, bien que suivant un parcours académique et professionnel classique (Brown University, McKinsey), reste discret et ne détient aucun rôle opérationnel visible au sein du groupe. Leur héritage est marqué par le divorce très médiatisé et coûteux de leurs parents, mais aussi par la transformation de SK Hynix en un acteur mondial de l'ère de l'IA. La succession ne se résume plus à une simple transmission d'actions ou de titre ; elle exige des héritiers qu'ils prouvent leurs compétences dans un paysage où la technologie, la politique internationale et l'innovation disruptive redéfinissent les règles du pouvoir.

marsbitIl y a 7 h

L'affaire de divorce de Chey Tae-won finalisée : Révélations sur les lignes cachées de succession derrière le conglomérat de mille milliards de SK Hynix

marsbitIl y a 7 h

2 mois pour passer de 8,8 à 68 milliards d'euros d'évaluation ! La plus grande plateforme de transit d'IA, OpenRouter, sur le point d'être rachetée

**Résumé en français :** Stripe, le géant du paiement en ligne, négocierait l'acquisition d'OpenRouter, une place de marché et couche d'IA de type "routeur" ou "agrégateur", pour près de 100 milliards de dollars. Cette valorisation représente une multiplication par près de sept par rapport à l'évaluation d'OpenRouter il y a deux mois (13 milliards de dollars). Fondée en 2023 par Alex Atallah (cofondateur d'OpenSea), OpenRouter agit comme un intermédiaire crucial pour les développeurs d'applications d'IA. Sa plateforme permet d'accéder via une seule API à plus de 400 grands modèles de langage (comme GPT, Claude, et de nombreux modèles open source) et choisit automatiquement le modèle le plus adapté à chaque tâche en fonction du coût, des performances et de la vitesse. Cela permet aux applications en aval de réduire leurs factures de "réflexion" (inference) sans que l'utilisateur final ne voie la différence. Pour Stripe, cette acquisition stratégique s'inscrit dans une volonté de devenir l'infrastructure de paiement et de gestion de la consommation pour l'économie de l'IA. Fin 2025, Stripe avait déjà acquis Metronome, une plateforme de facturation à l'usage pour l'IA. En combinant OpenRouter (choix du modèle) et Metronome (facturation précise), Stripe cherche à offrir une solution intégrée pour le routage, la mesure et le paiement de la consommation d'IA, consolidant ainsi son rôle de "caisse" et de "centre de régulation" de cette nouvelle économie.

链捕手Il y a 7 h

2 mois pour passer de 8,8 à 68 milliards d'euros d'évaluation ! La plus grande plateforme de transit d'IA, OpenRouter, sur le point d'être rachetée

链捕手Il y a 7 h

D'OpenSea à OpenRouter : le scénario de la « sortie en haut de cycle » d'Alex Atallah se répète ?

**OpenRouter, la plateforme d'agrégation de modèles d'IA fondée par Alex Atallah, pourrait être rachetée par Stripe pour près de 100 milliards de dollars**, selon le Wall Street Journal. Cette transaction potentielle, si elle se concrétise, marquerait le deuxième succès d'Atallah à construire une entreprise valorisée à des dizaines de milliards, après avoir cofondé la place de marché NFT OpenSea. OpenRouter, décrit comme le "Stripe de l'IA", sert de point d'accès unifié à plus de 400 modèles d'IA pour environ 10 millions d'utilisateurs. Sa croissance a été fulgurante, passant d'une valorisation de 1,3 milliard de dollars en mars 2026 à une évaluation potentielle de 100 milliards aujourd'hui. L'article souligne un parallèle avec le parcours d'Atallah chez OpenSea, qu'il a quittée avant le refroidissement du marché NFT. Aujourd'hui, face à une concurrence croissante dans l'agrégation de modèles d'IA et à une activité essentiellement basée sur des frais de plateforme (5-5,5%), la vente à un géant comme Stripe pourrait apparaître comme un choix stratégique pour "sortir au sommet". La valeur réelle d'OpenRouter pour un acquéreur résiderait moins dans ses revenus actuels que dans les vastes quantités de données d'utilisation réelle de l'IA qu'elle a accumulées. Ces informations sur les performances, les préférences des développeurs et la dynamique du marché sont un atout unique. La transaction, si elle aboutit, pose la question : s'agit-il d'une juste reconnaissance de la valeur des infrastructures d'IA ou d'un possible signal de sommet pour le secteur ?

链捕手Il y a 7 h

D'OpenSea à OpenRouter : le scénario de la « sortie en haut de cycle » d'Alex Atallah se répète ?

链捕手Il y a 7 h

Trading

Spot
活动图片