Tens of Millions of Errors Per Hour: Investigation Reveals the 'Accuracy Illusion' of Google AI Search

marsbitPublié le 2026-04-10Dernière mise à jour le 2026-04-10

Résumé

A New York Times investigation, in collaboration with AI startup Oumi, reveals significant accuracy and reliability issues with Google's AI Overviews search feature. Testing over 4,300 queries showed the accuracy rate improved from 85% (Gemini 2) to 91% (Gemini 3). However, given Google's scale of ~5 trillion annual searches, this 9% error rate translates to over 57 million incorrect answers generated hourly. A more critical issue is the prevalence of unsubstantiated citations. For correct answers, the rate of "unfounded citations"—where provided source links do not support the AI's claims—worsened, rising from 37% with Gemini 2 to 56% with Gemini 3. This makes it difficult for users to verify the information. The AI also heavily relies on low-quality sources, with Facebook and Reddit being its second and fourth most cited domains. Furthermore, the system is highly susceptible to manipulation. A BBC journalist successfully "poisoned" it by publishing a fake article; Google's AI began presenting the false information as fact within 24 hours. Google disputed the study's methodology, criticizing the use of the SimpleQA benchmark and an AI model (Oumi's HallOumi) to evaluate its own AI. The company maintains that its internal safeguards and ranking systems improve accuracy beyond the base model's performance.

Author: Claude, Deep Tide TechFlow

Deep Tide Introduction: The latest test by The New York Times in collaboration with AI startup Oumi shows that the accuracy rate of Google Search's AI Overviews feature is about 91%. However, given Google's scale of processing 5 trillion searches annually, this translates to tens of millions of incorrect answers generated every hour. More troublingly, even when the answers are correct, over half of the cited links fail to support their conclusions.

Google is delivering misinformation to users on an unprecedented scale, and most people are completely unaware.

According to The New York Times, AI startup Oumi, commissioned by the publication, used the industry-standard test SimpleQA developed by OpenAI to evaluate the accuracy of Google's AI Overviews feature. The test covered 4,326 search queries, conducting one round in October last year (powered by Gemini 2) and another in February this year (upgraded to Gemini 3). The results showed that Gemini 2's accuracy was about 85%, which improved to 91% with Gemini 3.

91% sounds good, but it's a different story when considering Google's scale. Google processes approximately 5 trillion search queries annually. Calculating with a 9% error rate, AI Overviews generates over 57 million inaccurate answers per hour, nearly 1 million per minute.

Correct Answers, Wrong Sources

More alarming than the accuracy rate is the issue of "unanchored" citation sources.

Oumi's data shows that in the Gemini 2 era, 37% of correct answers had "unsupported citations," meaning the links attached to the AI summaries did not support the information provided. After upgrading to Gemini 3, this proportion increased instead of decreasing, jumping to 56%. In other words, while the model gives correct answers, it's increasingly failing to "show its work."

Oumi CEO Manos Koukoumidis pointedly questioned: "Even if the answer is correct, how do you know it's correct? How do you verify it?"

The problem is exacerbated by AI Overviews' heavy reliance on low-quality sources. Oumi found that Facebook and Reddit are the second and fourth most cited sources for AI Overviews, respectively. In inaccurate answers, Facebook was cited 7% of the time, higher than the 5% in accurate answers.

BBC Journalist's Fake Article "Poisoned" Results Within 24 Hours

Another serious flaw of AI Overviews is its susceptibility to manipulation.

A BBC journalist tested the system with a deliberately fabricated false article. In less than 24 hours, Google's AI Overview presented the false information from the article as fact to users.

This means anyone who understands how the system works could potentially "poison" AI search results by publishing false content and boosting its traffic. Google spokesperson Ned Adriance responded by saying the search AI feature is built on the same ranking and security mechanisms that block spam, and claimed that "most examples in the test are unrealistic queries that people wouldn't actually search for."

Google's Rebuttal: The Test Itself Is Flawed

Google raised several objections to Oumi's research. A Google spokesperson called the study "seriously flawed," citing reasons including: the SimpleQA benchmark itself contains inaccurate information; Oumi used its own AI model HallOumi to judge another AI's performance, potentially introducing additional errors; and the test content doesn't reflect real user search behavior.

Google's internal tests also showed that when Gemini 3 operates independently outside the Google Search framework, it produces false outputs at a rate as high as 28%. But Google emphasized that AI Overviews leverages the search ranking system to improve accuracy, performing better than the model itself.

However, as PCMag's commentary pointed out the logical paradox: If your defense is that "the report pointing out our AI's inaccuracies itself uses potentially inaccurate AI," this probably doesn't enhance users' confidence in your product's accuracy.

Questions liées

QWhat is the accuracy rate of Google's AI Overviews feature according to the Oumi study?

AThe accuracy rate of Google's AI Overviews was found to be approximately 91% when powered by Gemini 3, an improvement from about 85% with Gemini 2.

QHow many inaccurate answers does the article estimate Google's AI Overviews produces per hour?

ABased on Google's annual volume of 5 trillion searches and a 9% error rate, the AI Overviews feature is estimated to produce over 57 million inaccurate answers per hour.

QWhat is the 'unsubstantiated citation' problem identified in the report?

AThe 'unsubstantiated citation' problem refers to instances where the AI Overviews provides a correct answer, but the attached source links do not actually support the information given. This issue increased from 37% with Gemini 2 to 56% with Gemini 3.

QWhich low-quality websites are frequently used as sources by AI Overviews, according to the Oumi data?

AAccording to Oumi's data, Facebook and Reddit are the second and fourth most cited sources by AI Overviews, with Facebook being cited more frequently in inaccurate answers.

QHow did Google respond to the findings of the Oumi study?

AGoogle criticized the study, calling it 'seriously flawed.' Their spokesperson argued that the SimpleQA benchmark itself contains inaccuracies, that using an AI (HallOumi) to judge another AI introduces errors, and that the test queries do not reflect real user search behavior.

Lectures associées

La Banque d'Italie ne voit pas d'avantages systémiques des stablecoins dans les transferts

L'étude de la Banque d'Italie conclut que les stablecoins n'offrent pas d'avantage systémique durable en termes de coût et de rapidité pour les transferts d'argent. Les avantages potentiels sont annulés par les frais de conversion vers et depuis les monnaies fiduciaires et par l'efficacité des infrastructures de paiement locales. La recherche a comparé des transferts de 200 USDC sur 10 couloirs bilatéraux (Italie vers Brésil, Argentine, Japon, Émirats Arabes Unis, Afrique du Sud). Le coût total des transferts en stablecoins variait de 0,3% à près de 9%. Les délais étaient inférieurs à 20 minutes dans les pays dotés de systèmes de paiement instantané, mais pouvaient atteindre 1 à 2 jours ouvrables ailleurs. Les principaux coûts et retards sont liés au change de devises et à la qualité de l'infrastructure locale, plutôt qu'aux frais de blockchain. Bien que souvent moins chers que la moyenne mondiale des transferts (6,65%), les stablecoins n'étaient plus avantageux que dans 3 cas sur 7 par rapport au service Wise. Les auteurs estiment que l'utilité serait plus forte si les stablecoins pouvaient être dépensés directement, sans reconversion. Ils notent également qu'une réglementation trop restrictive complique l'usage pour les clients tout en n'éliminant pas la demande. Le marché des stablecoins a enregistré en juillet sa plus forte baisse mensuelle depuis l'effondrement de Terra, perdant plus de 10 milliards de dollars.

cryptonews.ruIl y a 50 mins

La Banque d'Italie ne voit pas d'avantages systémiques des stablecoins dans les transferts

cryptonews.ruIl y a 50 mins

Le « boom du Bitcoin » en plein essor : Une nouvelle déclaration de Saylor suscite des spéculations sur des achats

Michael Saylor, président exécutif de MicroStrategy (MSTR), a relancé les spéculations sur un nouvel achat de bitcoins par la société en publiant le message « Bitcoin Drive engaged » le 2 août, accompagné de son tableau de suivi habituel. Cette pratique précède généralement les annonces officielles du trésor. Le rapport affiché montrait que les réserves de MicroStrategy s'élevaient à 843 775 BTC, d'une valeur marchande d'environ 53,25 milliards de dollars, avec un prix d'acquisition moyen de 75 653 dollars et une perte non réalisée de 10,58 milliards de dollars. Cependant, le registre public en temps réel de la société indique deux ventes récentes totalisant 3 588 BTC, ramenant le stock de 847 363 à 843 775 BTC. Ces ventes, déclarées à la SEC, visaient à financer des dividendes d'actions privilégiées et à reconstituer les réserves en dollars, qui s'élèvent désormais à environ 3,75 milliards de dollars. La société a subi une perte opérationnelle de 8,33 milliards de dollars au deuxième trimestre 2026, en grande partie due à une perte non réalisée sur ses actifs numériques. La direction pourrait vendre jusqu'à 1,25 milliard de dollars de bitcoins supplémentaires pour ses obligations en cash. L'annonce attendue lundi révélera si le message « Bitcoin Drive » signale une reprise des achats d'accumulation, alors que MicroStrategy équilibre son énorme stock de bitcoins avec ses engagements financiers croissants.

cryptonews.ruIl y a 52 mins

Le « boom du Bitcoin » en plein essor : Une nouvelle déclaration de Saylor suscite des spéculations sur des achats

cryptonews.ruIl y a 52 mins

Le motif « Tête et Épaules inversé » sur le graphique du Bitcoin annonce une montée vers 67 200 $

Malgré un léger recul début août, les graphiques de prix, notamment celui du Bitcoin, forment un modèle de renversement baissier. Actuellement, le BTC oscille autour de 63 200 $, formant l'épaule droite de la classique figure inversée "tête et épaules". L'analyste Axel Kibard de TechCharts voit là la seule réelle raison d'optimisme à court terme pour les haussiers ce mois-ci. La question principale est de savoir si les acheteurs auront la force de pousser le Bitcoin vers le niveau clé de 67 000 $. Parallèlement, dans la paire ETH/BTC, un fond de renversement similaire a déjà été franchi à la hausse. L'Ethereum, en tendance haussière, se dirige vers un objectif technique de 0,0312, indiquant que les grands capitaux préfèrent actuellement investir dans l'ETH plutôt que dans le Bitcoin, ce qui draine la liquidité et les volumes nécessaires à une reprise rapide du BTC. Face au dollar, l'Ethereum teste prudemment le niveau de support à 1 875 $, une résistance qui, si elle est maintenue, pourrait ouvrir la voie vers 2 163 $. Cette force relative de l'ETH est un signal positif pour le marché, mais la situation reste tendue pour les détenteurs de Bitcoin. Soit le BTC suit l'exemple de l'ETH et monte rapidement au-dessus de 67 200 $ pour confirmer le renversement, soit le modèle échoue. Selon Kibard, si une attaque de la ligne de cou (neckline) n'intervient pas dans les prochains jours, les baissiers reprendront le contrôle et pousseront le Bitcoin vers des niveaux de support solides à 60 000 $, voire 58 000 $.

cryptonews.ruIl y a 53 mins

Le motif « Tête et Épaules inversé » sur le graphique du Bitcoin annonce une montée vers 67 200 $

cryptonews.ruIl y a 53 mins

Les actions des entreprises d'IA se négocient comme des « mèmes cryptos », tandis que le Bitcoin reste stable – Revue de la semaine

Cette semaine, l'attention financière s'est largement détournée du Bitcoin, relativement stable autour de 64 000 $, pour se concentrer sur une volatilité extrême dans le secteur des actions liées à l'intelligence artificielle (IA). Les marchés asiatiques, notamment en Corée du Sud, ont subi des chutes sévères, en partie déclenchées par la liquidation forcée du fonds « Situational Awareness » de Leopold Aschenbrenner, entraînant des pertes massives. Le secteur des semi-conducteurs et de l'IA montre des signes de surchauffe, suscitant des débats sur un éventuel ralentissement. Dans le domaine des cryptomonnaies, l'ambiance reste difficile. Plusieurs plateformes d'échange (BitMEX, BitMart) ont annoncé leur fermeture, tandis que d'autres entreprises comme Coinbase et Uphold procèdent à des réductions de personnel. MicroStrategy continue sa stratégie d'accumulation de bitcoins et de rachat de ses propres actions. Les discussions portent également sur les risques potentiels pour des écosystèmes comme Solana si des applications populaires (Pump.fun, Trade.xyz) décidaient de lancer leur propre blockchain. Par ailleurs, une faille de sécurité majeure concernant le portefeuille matériel Coldcard a été mise en lumière, rappelant les risques du self-custody. Enfin, le projet d'IA décentralisée Bittensor (TAO) a attiré l'attention de certains investisseurs de capital-risque, mais des mises en garde sont émises contre un possible engouement spéculatif similaire à celui pour les memecoins. La semaine a été marquée par des interventions macroéconomiques, comme celle de la Japon pour soutenir le yen, et par les anticipations concernant la politique de la Fed.

cryptonews.ruIl y a 1 h

Les actions des entreprises d'IA se négocient comme des « mèmes cryptos », tandis que le Bitcoin reste stable – Revue de la semaine

cryptonews.ruIl y a 1 h

Trading

Spot
活动图片