À l'instant, Anthropic et OpenAI ont simultanément dévoilé des mises à jour majeures de leur mode vocal !
Du côté de Claude, on est passé du seul modèle Haiku à toute la gamme Opus 4.8 et Sonnet 5. Non seulement il peut maintenant piloter Gmail, Calendrier, Slack dans la conversation, mais il s'est aussi étendu à 11 langues, mais sans le chinois.

Du côté d'OpenAI, le GPT-Live full-duplex est directement disponible sur les bureaux macOS et Windows. Il suffit de parler pour commander toute une équipe d'Agents simultanément, et il prend en charge le chinois.

Grande mise à jour de Claude Voice
Auparavant, le mode vocal de Claude ne pouvait faire tourner que Haiku, le plus petit modèle.
Vous pouviez discuter avec lui vocalement, il comprenait, mais pour des questions un peu complexes, il avait tendance à déraper.
Maintenant, Opus 4.8 et Sonnet 5 sont disponibles.
Vous pouvez changer de modèle en cours de conversation. Le système appelle automatiquement la version la plus rapide du modèle sélectionné. Attention, c'est la version la plus rapide, pas la version de raisonnement complète.

La bonne nouvelle est que le mode vocal charge par défaut le modèle que vous avez utilisé lors de votre dernier chat écrit, le contexte est continu entre le texte et la voix, vous pouvez passer de l'un à l'autre sans interruption.
Pour l'interaction, il y a deux modes : Hands-free écoute en continu et répond automatiquement, Push-to-talk appuyez pour parler, relâchez pour terminer.
Bien sûr, le plus important, c'est l'« appel d'outils ».
Dans une conversation vocale, Claude peut maintenant se connecter directement à votre Gmail, Google Calendar, Slack, Google Docs, Canva.
Dites une phrase, il fouille vos emails, consulte votre agenda, lit des documents, envoie des messages à votre place.
Le product manager d'Anthropic, Robert Bye, a donné quelques exemples :
· Résume-moi ce que j'ai manqué sur Slack ces dernières heures.
· Envoie le résumé du nouveau PRD à Nick sur Slack.
Vous dites les choses, et le travail est fait.

Techniquement, l'appel d'outils vocal utilise la même architecture Connectors que le chat écrit, ce n'est pas une version limitée, et il demande votre autorisation avant chaque appel.
Tous les forfaits peuvent l'utiliser, mais les utilisateurs gratuits n'ont que Haiku avec 1 connecteur, pour la suite Opus complète, il faut payer. L'utilisation est déduite du quota habituel. Le déploiement public sur toutes les plateformes commence aujourd'hui.
11 langues, pas de chinois
Au niveau des langues, le mode vocal de Claude prend désormais en charge 11 langues : anglais, français, allemand, hindi, indonésien, italien, japonais, coréen, portugais brésilien, espagnol d'Amérique latine, espagnol d'Europe.
Regardez de la première à la dernière, pas de chinois.
Pour cette partie des utilisateurs, il faudra continuer à taper.

De plus, Claude ne détecte pas automatiquement la langue que vous parlez.
Vous devez lui demander explicitement de changer, par exemple « Parle-moi en japonais s'il te plaît », ou aller le sélectionner manuellement dans les paramètres. Si vous ne changez pas, c'est l'anglais par défaut.
Il est intéressant de noter que des développeurs avaient précédemment extrait d'une liste de langues dans le code de l'application Claude une liste de 18 langues, où Chinese était clairement indiqué.
Résultat, 18 langues sont devenues 11, le chinois a été purement et simplement supprimé.

ChatGPT Voice débarque sur le bureau
En comparaison, la voix de ChatGPT, elle, a changé complètement d'architecture à la base.
Elle utilise GPT-Live, un modèle vocal full-duplex publié le 8 juillet.
Full-duplex signifie que le modèle peut traiter simultanément les flux audio d'entrée et de sortie, et prendre des dizaines de décisions par seconde, pouvant répondre sans attendre que vous ayez fini de parler.
C'est pourquoi GPT-Live fait « hmm » « je vois » pendant que vous parlez, comme une personne réelle qui écoute.
Allant plus loin, il est basé sur une architecture à deux couches.
À l'avant-plan, un modèle vocal léger et à faible latence, responsable de la conversation en temps réel, de la gestion des tours de parole, des interruptions, tout ce qui nécessite une réaction en millisecondes.
À l'arrière-plan, c'est GPT-5.5 qui s'occupe du raisonnement complexe, de la recherche web, des tâches d'Agent.
Lorsque vous posez une question nécessitant une réflexion profonde, GPT-Live délègue la tâche de manière asynchrone au GPT-5.5 en arrière-plan, puis continue de discuter avec vous, et fait son rapport lorsque le résultat est prêt.
OpenAI appelle cela le « Raisonnement Délégué » (Delegated Reasoning).

Concrètement, OpenAI a complètement découplé la latence de la conversation et la profondeur du raisonnement. Vous n'avez pas besoin d'attendre que le grand modèle ait fini de réfléchir pour pouvoir continuer à parler.
La profondeur de raisonnement peut aussi être ajustée sur trois niveaux : Instant le plus rapide, Medium raisonnement moyen, High raisonnement profond, correspondant respectivement à différents niveaux de GPT-5.5. Les utilisateurs gratuits utilisent GPT-Live-1 mini.
D'après les benchmarks, cette architecture de délégation est vraiment efficace, le mode vocal n'est enfin plus une « version dégradée du chat ».
GPQA (raisonnement scientifique expert) est passé de 45,3 % à 84,2 % par rapport au précédent mode vocal avancé.
BrowseComp (capacité de recherche web par Agent) est passé de 0,7 % à 75,2 %.
Sur le benchmark τ3-Voice Telecom simulant un scénario réel de service client téléphonique multi-tours, GPT-Live surpasse aussi complètement la concurrence.



En parlant, plusieurs Agents tournent en même temps
Avec ces bases, OpenAI l'a directement déployé sur le bureau.
À partir d'aujourd'hui, ChatGPT Voice débarque officiellement sur les versions bureau de macOS et Windows.
Vous pouvez définir un raccourci clavier global pour invoquer ChatGPT Voice d'un seul geste dans n'importe quelle application.
Sur macOS, il y a aussi la fonction Appshots, ChatGPT peut lire directement le contenu de votre fenêtre active actuelle, pour l'utiliser comme contexte de conversation.
Par exemple, en parlant à Excel « aide-moi à calculer la croissance annuelle du T3 », il peut voir votre tableau.

De plus, vous pouvez utiliser la voix pour commander à plusieurs Agents de travailler simultanément dans ChatGPT Work et Codex.
Faites écrire du code à un Agent pendant qu'un autre recherche de la documentation, il suffit de le dire.
GPT-Live discute avec vous à l'avant-plan, tout en lançant, vérifiant, changeant plusieurs threads de travail en arrière-plan simultanément, sans que vous ayez besoin de revenir au clavier.
Actuellement, disponible pour les forfaits Plus, Pro, Business, Edu, Enterprise.
La différence se sent en 10 secondes
Peut-on interrompre ?
Claude vocal fonctionne en alternance, il réfléchit une fois que vous avez fini de parler. Vous voulez l'interrompre ? Attendez.
GPT-Live peut être interrompu. Vous changez d'avis au milieu d'une phrase, il s'arrête immédiatement et suit votre nouvelle idée. Il se souvient d'où vous en étiez avant l'interruption.
Peut-on faire plusieurs choses à la fois ?
Claude ne fait qu'une chose à la fois – discuter vocalement.
ChatGPT Voice sur le bureau peut à la fois vous parler et, en arrière-plan, manipuler l'ordinateur, commander à plusieurs Agents de travailler chacun de leur côté.
« Ouvre-moi une PR, et vérifie en même temps les logs CI d'hier », les deux tâches peuvent commencer à s'exécuter simultanément.
Peut-il agir directement ?
Claude vocal peut, via les connecteurs, appeler des outils SaaS comme Gmail, Calendrier, mais il n'a pas accès à votre bureau.
ChatGPT Voice sur le bureau, avec Computer Use, peut manipuler directement votre ordinateur. Fichiers, programmes, terminal, il peut tout toucher.
À quel point pense-t-il profondément ?
L'atout de Claude est Opus 4.8, qui reste l'un des modèles les plus puissants pour les tâches de raisonnement en plusieurs étapes et de synthèse des connaissances. Mais le mode vocal utilise la version la plus rapide d'Opus, pas la version de raisonnement à pleine puissance.
Du côté de GPT-Live, le niveau High peut déléguer de manière asynchrone à GPT-5.5 Thinking pour un raisonnement profond, ce qui permet en fait, dans un scénario vocal, d'utiliser une capacité de raisonnement proche de la pleine puissance.

L'ère où même la zone de saisie devient inutile
À ce stade, la bifurcation des deux entreprises est claire.
Claude, en alternance, se concentre sur l'utilisation de vos propres Gmail, calendrier, documents, pour vous aider à organiser vos propres affaires.
Le GPT-Live full-duplex se concentre sur la sensation de parler à une personne. Il peut être interrompu, gérer plusieurs threads, contrôler l'ordinateur, vous faisant oublier que c'est une IA en face.
Pour ceux qui ne codent pas, Claude est bien moins complexe, si vous avez des emails à trier, un emploi du temps à organiser, il suffit d'ouvrir la bouche.
La voie d'OpenAI est plus agréable et plus geek, il faut vraiment avoir une équipe d'Agents sous la main, de vrais travaux à leur confier.
Comme l'a dit Greg Brockman, « Comparée à la voix, taper est en soi une chose très peu naturelle. »
Ces touches en plastique qui ont accompagné l'humanité pendant quarante ans sont désormais officiellement poussées dans leurs derniers retranchements à la fois par OpenAI et Anthropic.

Références :
https://x.com/testingcatalog/status/2080401533728940372
https://x.com/OpenAI/status/2080378182469857576
https://x.com/testingcatalog/status/2080385285951521150
https://x.com/claudeai/status/2080376094939603366
https://claude.com/blog/think-through-hard-problems-in-voice-mode
Cet article provient du compte WeChat public « Xin Zhi Yuan », auteur : ASI Apocalypse, éditeur : Moïse





