Des dizaines de millions d'erreurs par heure : une enquête révèle « l'illusion de précision » de la recherche IA de Google

marsbitPublié le 2026-04-13Dernière mise à jour le 2026-04-13

Résumé

Google, avec son énorme volume de recherches (5 billions par an), générerait des millions de réponses erronées chaque heure via sa fonction AI Overviews, selon une étude commandée par le *New York Times* et menée par Oumi. Bien que le taux de précision soit de 91% avec Gemini 3, cela représente toujours un flux massif de désinformation. Pire, plus de la moitié des réponses correctes citent des sources qui ne corroborent pas l'information donnée. Les plateformes comme Facebook et Reddit sont fréquemment citées, même pour des réponses fausses. De plus, le système est facilement manipulable : une fausse information a été intégrée en moins de 24 heures. Google conteste la méthodologie de l'étude, arguant que les tests ne reflètent pas les requêtes réelles des utilisateurs et utilisent une IA pour évaluer une autre IA.

Auteur: Claude, Deep Tide TechFlow

Guide de Deep Tide: Un test récent du New York Times et de la startup d'IA Oumi révèle que la fonction de résumé IA (AI Overviews) de Google Search a un taux de précision d'environ 91 %. Cependant, compte tenu du volume annuel de 5 000 milliards de recherches traitées par Google, cela signifie que des dizaines de millions de réponses erronées sont générées chaque heure. Plus problématique encore, même lorsque la réponse est correcte, plus de la moitié des liens de référence ne permettent pas d'étayer la conclusion.

Google diffuse des informations erronées à une échelle sans précédent, et la plupart des utilisateurs n'en ont pas conscience.

Selon le New York Times, la startup Oumi, mandatée par le journal, a évalué la précision de la fonction AI Overviews de Google en utilisant le test de référence SimpleQA, développé par OpenAI. Le test, portant sur 4326 requêtes de recherche, a été réalisé en octobre dernier (alimenté par Gemini 2) puis en février de cette année (après la mise à niveau vers Gemini 3). Les résultats montrent que le taux de précision de Gemini 2 était d'environ 85 %, et qu'il est passé à 91 % avec Gemini 3.

91 % semble correct, mais à l'échelle de Google, c'est une autre histoire. Google traite environ 5 000 milliards de requêtes de recherche par an. Avec un taux d'erreur de 9 %, AI Overviews génère plus de 57 millions de réponses inexactes par heure, soit près d'un million par minute.

La réponse est juste, mais la source est fausse

Plus inquiétant que le taux de précision est le problème du « décrochage » des sources de référence.

Les données d'Oumi montrent qu'à l'ère de Gemini 2, 37 % des réponses correctes présentaient un problème de « référence non fondée », c'est-à-dire que les liens fournis dans le résumé IA ne soutenaient pas l'information donnée. Après la mise à niveau vers Gemini 3, ce pourcentage n'a pas diminué mais a augmenté pour atteindre 56 %. En d'autres termes, le modèle donne de plus en plus de réponses correctes sans « rendre ses devoirs » (citer ses sources correctement).

La question du PDG d'Oumi, Manos Koukoumidis, est on point : « Même si la réponse est correcte, comment le savez-vous ? Comment pouvez-vous le vérifier ? »

Le fait qu'AI Overviews cite abondamment des sources de faible qualité aggrave ce problème. Oumi a découvert que Facebook et Reddit étaient respectivement les deuxième et quatrième sources les plus citées par AI Overviews. Parmi les réponses inexactes, Facebook était cité dans 7 % des cas, contre 5 % pour les réponses exactes.

Un faux article d'un journaliste de la BBC a « empoisonné » les résultats en moins de 24 heures

Un autre défaut grave d'AI Overviews est sa facilité à être manipulé.

Un journaliste de la BBC a testé le système avec un article délibérément fabriqué de toutes pièces. En moins de 24 heures, le résumé IA de Google présentait les fausses informations de l'article comme des faits aux utilisateurs.

Cela signifie que toute personne comprenant le fonctionnement du système pourrait potentiellement « empoisonner » les résultats de recherche IA en publiant du contenu faux et en augmentant son trafic. La réponse du porte-parole de Google, Ned Adriance, a été que la fonction de recherche IA s'appuie sur les mêmes mécanismes de classement et de sécurité que ceux utilisés pour bloquer le spam, et que « la plupart des exemples [du test] sont des requêtes irréalistes que les gens ne rechercheraient pas réellement ».

La contre-argumentation de Google : le test lui-même est problématique

Google a soulevé plusieurs objections concernant l'étude d'Oumi. Un porte-parole a qualifié l'étude de « gravement lacunaire », pour les raisons suivantes : le test de référence SimpleQA contient lui-même des informations inexactes ; Oumi a utilisé son propre modèle d'IA, HallOumi, pour évaluer les performances d'une autre IA, ce qui pourrait introduire des erreurs supplémentaires ; le contenu testé ne reflète pas le comportement de recherche réel des utilisateurs.

Les tests internes de Google ont également montré que Gemini 3, fonctionnant indépendamment du cadre de recherche Google, produisait des sorties hallucinées (fausses) à un taux élevé de 28 %. Mais Google a souligné qu'AI Overviews, en s'appuyant sur le système de classement des recherches, améliore la précision et surpasse les performances du modèle seul.

Cependant, comme le souligne un commentaire de PCMag mettant en lumière un paradoxe logique : si votre argument de défense est « le rapport qui pointe l'inexactitude de notre IA utilise lui-même une IA potentiellement inexacte », cela n'est probablement pas de nature à renforcer la confiance des utilisateurs en la précision de votre produit.

Questions liées

QQuel est la précision des résumés IA de Google selon l'étude du New York Times et Oumi ?

ASelon l'étude, la précision des résumés IA de Google (AI Overviews) est d'environ 91% avec Gemini 3, contre 85% avec Gemini 2.

QCombien de réponses inexactes les AI Overviews de Google produisent-elles par heure ?

ACompte tenu du volume de 5 000 milliards de recherches traitées par an par Google et d'un taux d'erreur de 9%, les AI Overviews produisent plus de 57 millions de réponses inexactes par heure.

QQuel est le problème principal avec les sources citées par les AI Overviews ?

ALe problème principal est le 'référencement non fondé' : même lorsque la réponse est correcte, plus de la moitié (56% avec Gemini 3) des liens cités ne soutiennent pas la conclusion de l'IA.

QQuels sont les sites web de faible qualité souvent cités par l'IA de Google ?

AFacebook et Reddit sont respectivement les deuxième et quatrième sources les plus citées par les AI Overviews, Facebook étant encore plus fréquemment cité dans les réponses inexactes.

QComment Google a-t-il répondu aux conclusions de l'étude d'Oumi ?

AGoogle a contesté l'étude, la qualifiant de 'présentant de graves lacunes', en critiquant le benchmark SimpleQA, l'utilisation d'un autre modèle IA (HallOumi) pour l'évaluation, et la non-représentativité des requêtes de test par rapport aux recherches réelles des utilisateurs.

Lectures associées

De l'or au Bitcoin : Offre fixe + frénésie institutionnelle, une répétition des prix "explosifs" en vue ?

De l'or au Bitcoin : offre fixe et engouement institutionnel, prêts à rejouer une hausse explosive des prix ? L'article compare les trajectoires potentielles du Bitcoin et de l'or, en se focalisant sur l'impact des ETF. L'analyste Eric Balchunas de Bloomberg Intelligence établit un parallèle entre l'ETF Bitcoin et l'ETF or, lancé en 2004. Il note que les deux actifs, sans rendement intrinsèque, voient leur prix dicté par le sentiment des investisseurs. L'histoire de l'ETF or montre des cycles de hausses spectaculaires, de corrections douloureuses et de longues phases de reprise, chaque cycle établissant un plus haut historique. Le Bitcoin, après l'approbation des ETF spot début 2024, a connu un afflux massif de capitaux institutionnels, certains fonds devenant les ETF à la croissance la plus rapide. Cependant, cette adoption s'accompagne d'une volatilité accrue. Les flux entrants et sortants des grands ETF comme l'IBIT de BlackRock peuvent influencer significativement le marché. Malgré un repli important du prix en 2026, de nombreux observateurs restent optimistes sur le long terme. Ils voient dans le Bitcoin un "or numérique" bénéficiant d'une offre fixe (mécanisme de halving) et d'une adoption institutionnelle croissante. Les ETF facilitent l'accès pour les investisseurs traditionnels, amplifiant potentiellement la demande. En conclusion, si le Bitcoin devait capturer ne serait-ce qu'une fraction de la capitalisation boursière de l'or (près de 28 000 milliards de dollars), la perspective de hausse serait considérable. Ce parcours sera probablement semé d'une forte volatilité, mais l'arrivée continue de capitaux institutionnels pourrait poser les bases d'une nouvelle phase de croissance.

Foresight NewsIl y a 2 mins

De l'or au Bitcoin : Offre fixe + frénésie institutionnelle, une répétition des prix "explosifs" en vue ?

Foresight NewsIl y a 2 mins

Pourquoi les agents d'IA pour les achats peinent-ils à se généraliser ?

**Pourquoi les agents d'achat IA peinent à se généraliser ?** L'idée de confier à un agent IA un portefeuille pour qu'il achète de manière autonome semble être l'application ultime de l'IA. Cependant, ce récit confond les éléments simples et complexes de l'acte d'acheter, en plaçant à tort le paiement, l'étape la plus facile, au centre. L'achat se compose de deux actions fondamentales : la **recherche d'informations** (standardisable, déléguable à la machine) et le **jugement de valeur** (subjectif, lié aux préférences humaines). Si la recherche migre rapidement vers l'IA, le jugement de valeur ne peut être entièrement délégué. Il implique non seulement l'évaluation des options, mais surtout la **définition des besoins et des critères** (ce qui est important, les priorités), un processus itératif et subjectif qui reste de la souveraineté humaine. La limite décisive n'est pas entre produit standardisé et personnalisé, mais entre : **la corvée et le plaisir**. Pour les achats répétitifs et sans intérêt (papier, piles), une délégation totale à l'IA est pertinente. Pour les achats liés au plaisir ou à l'identité (vin, vêtements, livres), le choix *fait partie* de l'expérience. L'IA doit alors servir d'assistant de recherche, présentant une sélection restreinte, et laisser le choix final à l'humain. Le concept de "portefeuille IA" ne résout que le problème mineur du portage des fonds. Les solutions de paiement actuelles (Stripe, Mastercard Agent Pay, Google AP2) adoptent des approches d'autorisation limitée et contextuelle, sans nécessiter de confier un portefeuille complet à l'IA. Le véritable terrain d'application du portefeuille autonome pour l'IA est le **règlement automatisé entre machines (M2M)** ou les **achats professionnels standardisés (B2B)**, où les critères sont objectifs et les volumes élevés. Les vrais goulots d'étranglement pour les achats automatisés par IA sont ailleurs : 1. **Le manque de sources de données fiables** : avis falsifiés, contrefaçons. Une automatisation sûre nécessite des données vérifiables et une traçabilité des produits. 2. **L'impossibilité d'automatiser la définition des besoins humains** : C'est un processus intrinsèquement humain. Si l'IA définit nos critères à notre place, les préférences qui en résultent ne sont plus les nôtres. En conclusion, pour les plateformes de vente, l'avenir réside non pas dans la délégation totale du choix, mais dans l'optimisation des données pour faciliter la recherche par l'IA, tout en préservant et en enrichissant **l'expérience de choix** pour l'utilisateur humain, là où réside la valeur fondamentale des achats liés au plaisir.

Foresight NewsIl y a 58 mins

Pourquoi les agents d'IA pour les achats peinent-ils à se généraliser ?

Foresight NewsIl y a 58 mins

Après neuf mois de vente à découvert, un retournement complet, un trader célèbre prend position sur le Bitcoin autour de 64 000 dollars, la divergence haussière/baissière s'accélère sur le marché des crypto

Après neuf mois de baisse, le Bitcoin a perdu plus de 50% depuis son pic d'octobre 2025 et évolue désormais autour de 60 000 $. Cette phase baissière divise les analystes sur la question de savoir si le fond du marché a été atteint. Le trader renommé Doctor Profit, qui avait vendu à découvert avec succès cette descente, a annoncé le 19 juillet avoir clôturé toutes ses positions vendeuses. Il a initié un achat progressif de Bitcoin à partir de 64 000 $, estimant que le creux du cycle quadriennal pourrait arriver plus tôt que prévu. Son raisonnement repose sur des changements structurels : l'avancée de la régulation (CLARITY Act), la tokenisation d'actifs par des géants comme BlackRock, et l'attente de capitaux institutionnels massifs. À l'appui, l'analyste on-chain gumsays note une divergence haussière sur les graphiques hebdomadaires, persistante depuis 147 jours, une durée proche des 161 jours observés avant le creux de 2022. Cependant, le chercheur de cycles Jake Pahor oppose un argumentaire fondé sur l'histoire. En analysant les données depuis 2012, il identifie trois conditions communes à tous les fonds de marché depuis 2014 : une durée d'environ 12 mois, une peur extrême prolongée (score de risque <20), et un prix sous le "prix réalisé" (actuellement ~53 000$). Aucune de ces conditions n'est remplie dans le cycle actuel. Le marché est donc tiraillé entre ceux qui anticipent un rebond précoce, motivés par les nouvelles fondamentales, et ceux qui attendent des signaux de capitulation plus classiques avant de s'engager pleinement. La stratégie de Jake Pahor reflète cette prudence : il continue ses achats réguliers au niveau actuel mais réserve le gros de son capital pour des niveaux de panique plus extrêmes.

marsbitIl y a 1 h

Après neuf mois de vente à découvert, un retournement complet, un trader célèbre prend position sur le Bitcoin autour de 64 000 dollars, la divergence haussière/baissière s'accélère sur le marché des crypto

marsbitIl y a 1 h

Trading

Spot
活动图片