Десятки миллионов ошибок в час: исследование раскрывает «иллюзию точности» AI-поиска Google

marsbitОпубликовано 2026-04-13Обновлено 2026-04-13

Введение

Автор: Клод, Deep Chao TechFlow Согласно совместному исследованию The New York Times и стартапа Oumi, функция AI Overviews (ИИ-сводки) в Google Search демонстрирует точность около 91%. Однако, учитывая масштаб Google (5 триллионов запросов в год), это означает, что система ежечасно генерирует десятки миллионов ошибочных ответов — более 57 миллионов. Проблема усугубляется тем, что даже когда ответ верен, более половины (56% для Gemini 3) цитируемых источников не подтверждают выводы, сделанные ИИ. Часто используются низкокачественные источники, такие как Facebook и Reddit. Еще одной серьёзной проблемой является уязвимость к манипуляциям. Тест BBC показал, что ложная информация из намеренно сфабрикованной статьи начала появляться в ответах ИИ менее чем за 24 часа. Google оспаривает методологию исследования, заявляя о «серьёзных недостатках», включая использование другого ИИ (HallOumi) для оценки и нереалистичные тестовые запросы. Внутренние тесты Google показывают, что их модель Gemini 3 вне поисковой системы имеет уровень ошибок в 28%, но компания утверждает, что интеграция с поиском значительно повышает её точность.

Автор: Клод, Deep Chao TechFlow

Глубинный обзор: Совместное тестирование The New York Times и AI-стартапа Oumi показало, что точность функции AI-анонсов (AI Overviews) в поиске Google составляет около 91%. Однако с учётом масштаба Google, обрабатывающего 5 триллионов поисковых запросов в год, это означает, что ежечасно генерируются десятки миллионов ошибочных ответов. Что ещё серьёзнее, даже при правильных ответах более половины ссылок на источники не подтверждают выводы.

Google в беспрецедентных масштабах поставляет пользователям недостоверную информацию, и большинство об этом даже не подозревает.

Согласно The New York Times, AI-стартап Oumi по её заказу провёл оценку точности функции AI Overviews от Google с использованием отраслевого стандартного теста SimpleQA, разработанного OpenAI. Тестирование охватило 4326 поисковых запросов и проводилось в два этапа: в октябре прошлого года (на движке Gemini 2) и в феврале этого года (после обновления до Gemini 3). Результаты показали, что точность Gemini 2 составила около 85%, а Gemini 3 повысила её до 91%.

91% звучит неплохо, но в масштабах Google это выглядит иначе. Google обрабатывает около 5 триллионов поисковых запросов в год. При 9% уровне ошибок AI Overviews ежечасно генерирует более 57 миллионов неточных ответов, что приближается к 1 миллиону в минуту.

Ответ верный, но источник ошибочен

Беспокойнее, чем точность, является проблема «отрыва» источников цитирования.

Данные Oumi показывают, что во времена Gemini 2 в 37% правильных ответов существовала проблема «необоснованного цитирования», когда прикреплённые к AI-анонсу ссылки не подтверждали предоставленную информацию. После обновления до Gemini 3 этот показатель не снизился, а подскочил до 56%. Иными словами, модель, давая правильные ответы, всё хуже «делает домашнюю работу».

Вопрос генерального директора Oumi Маноса Кукумидиса бьёт в самую суть: «Даже если ответ правильный, откуда ты знаешь, что он правильный? Как ты это проверишь?»

Массовое цитирование AI Overviews низкокачественных источников усугубляет эту проблему. Oumi обнаружила, что Facebook и Reddit являются вторым и четвёртым по частоте источниками цитирования для AI Overviews. Среди неточных ответов Facebook цитировался в 7% случаев, что выше, чем 5% в точных ответах.

Фальшивая статья журналиста BBC «отравила» систему за 24 часа

Ещё один серьёзный недостаток AI Overviews — чрезвычайная лёгкость манипулирования.

Один журналист BBC провёл тест с помощью намеренно сфабрикованной фальшивой статьи, и менее чем за 24 часа AI-анонс Google начал представлять содержащуюся в ней ложную информацию как факт для пользователей.

Это означает, что любой, кто понимает механизм работы системы, может «отравить» AI-результаты поиска, публикуя ложный контент и накручивая его трафик. Пресс-секретарь Google Нед Адрианс в ответ на это заявил, что AI-функция поиска построена на тех же механизмах ранжирования и безопасности, что и блокировка спама, и что «большинство примеров в тесте — это нереалистичные запросы, которые люди на самом деле не ищут».

Возражение Google: проблемы в самом тесте

Google выдвинула ряд претензий к исследованию Oumi. Пресс-секретарь компании назвал это исследование «имеющим серьёзные недостатки»,理由包括: сам эталонный тест SimpleQA содержит неточную информацию; Oumi использовала собственную AI-модель HallOumi для оценки другой AI, что могло внести дополнительную погрешность; содержание теста не отражает реальное поведение пользователей при поиске.

Внутреннее тестирование Google также показало, что при самостоятельной работе Gemini 3 вне框架 поиска Google доля ложных выводов достигает 28%. Но Google подчеркивает, что AI Overviews, используя систему поискового ранжирования, повышает точность и работает лучше, чем модель сама по себе.

Однако, как указывает PCMag, возникает логический парадокс: если ваш довод в защиту — «отчёт, указывающий на неточность нашего AI, сам использует возможно неточный AI», то это вряд ли усилит доверие пользователей к точности вашего продукта.

Связанные с этим вопросы

QКакова точность функции AI Overviews в Google Поиске по данным тестирования?

AСогласно тестированию, проведенному компанией Oumi, точность AI Overviews составляет около 91% при использовании Gemini 3.

QСколько неточных ответов в час генерирует функция AI Overviews из-за масштабов Google?

AПри годовом объеме в 5 триллионов поисковых запросов и 9% уровне ошибок, AI Overviews генерирует более 57 миллионов неточных ответов в час.

QВ чем заключается проблема «необоснованных ссылок» в ответах AI Overviews?

AПроблема «необоснованных ссылок» означает, что ссылки, прилагаемые к ответам ИИ, не подтверждают предоставленную информацию. Эта проблема возросла с 37% до 56% после обновления до Gemini 3.

QКакие платформы часто цитируются в неточных ответах AI Overviews?

AFacebook и Reddit являются вторым и четвертым по частоте источниками цитирования. В неточных ответах Facebook цитируется в 7% случаев.

QКак Google ответил на критику точности AI Overviews?

AGoogle оспорил методы тестирования, заявив, что исследование имеет «серьезные недостатки», включая использование спорного бенчмарка SimpleQA и модели HallOumi от Oumi для оценки, что могло внести дополнительные ошибки.

Похожее

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

Исследование Банка Италии показало, что стейблкоины (на примере USDC) не демонстрируют устойчивых системных преимуществ в стоимости и скорости международных денежных переводов по сравнению с традиционными сервисами. Анализ транзакций на 200 USDC в 10 платежных коридорах (Италия — Бразилия, Аргентина, Япония, ОАЭ, ЮАР и др.) выявил, что финальная стоимость переводов варьировалась от 0,3% до почти 9%. Сроки исполнения колебались от менее 20 минут в коридорах с инфраструктурой мгновенных платежей до 1-2 рабочих дней в ее отсутствие. Ключевые издержки и задержки связаны не с комиссиями блокчейна, а с процессами конвертации в фиатные валюты и работой локальных платежных систем. Хотя в большинстве изучных направлений стоимость переводов со стейблкоинами была ниже среднемирового показателя в 6,65%, по сравнению с сервисом Wise преимущество наблюдалось только в трех из семи сопоставимых случаев. Авторы отмечают, что преимущества стейблкоинов могли бы быть более заметны, если бы их можно было напрямую тратить без конвертации. Также подчеркивается, что запретительное регулирование не устраняет спрос на стейблкоины, а излишне жесткие правила лишь усложняют их использование для розничных клиентов. В контексте исследования упоминается значительное снижение общей капитализации рынка стейблкоинов в июле.

cryptonews.ru19 мин. назад

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

cryptonews.ru19 мин. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

Исполнительный председатель MicroStrategy Майкл Сэйлор 2 августа опубликовал сообщение «Bitcoin Drive engaged», что вызвало спекуляции о новой покупке биткойнов компанией. Его отчет показал, что резерв MicroStrategy составляет 843 775 BTC стоимостью около $53,25 млрд, со средней себестоимостью $75 653 и нереализованным убытком в $10,58 млрд. Ранее аналогичный сигнал предшествовал объявлению о пополнении долларового резерва. В то же время, реестр компании отразил две недавние продажи на общую сумму 3 588 BTC, сократив запасы. Эти продажи, согласно документам SEC, были проведены для финансирования выплат по привилегированным акциям. Неделей ранее компания не покупала биткойны, увеличив свой долларовый резерв примерно до $3,75 млрд. Финансовые риски остаются высокими после отчетности об операционном убытке в $8,33 млрд за второй квартал 2026 года. Ожидается, что обновление данных в понедельник покажет, означает ли сообщение Сэйлора возврат к накоплению биткойнов, поскольку компания балансирует между своими крупными запасами криптовалюты и растущими денежными обязательствами.

cryptonews.ru21 мин. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

cryptonews.ru21 мин. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

Несмотря на медленное снижение в начале августа, на графике биткоина формируется перевёрнутая разворотная модель «голова и плечи». Цена $BTC колеблется около $63,200, формируя правое плечо, что является основным поводом для краткосрочного оптимизма. Ключевой вопрос — хватит ли покупателям сил для рывка к уровню $67,200 для подтверждения разворота. В то же время в паре ETH/BTC уже пробито разворотное дно. Ethereum демонстрирует относительную силу, закрепился в восходящем тренде и движется к цели 0,0312, а против доллара тестирует уровень $1875, открывая путь к $2163. Эта ротация капитала в пользу ETH лишает биткоин объёма, необходимого для быстрого роста. Таким образом, ситуация для биткоина остаётся напряжённой: либо он в ближайшие дни последует примеру Ethereum и осуществит быстрый рост выше $67,200, либо, если атака на «шею» паттерна не состоится, медведи возьмут контроль и отправят цену к уровням поддержки $60,000 и $58,000.

cryptonews.ru21 мин. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

cryptonews.ru21 мин. назад

Акции компаний, занимающихся искусственным интеллектом, торгуются как «мемокоины», в то время как биткоин практически не меняет цены — обзор недели

В еженедельном обзоре рассматривается волатильность на рынках, вызванная распродажей в секторе ИИ и проблемами крупного хедж-фонда «Situational Awareness», что привело к значительным падениям на азиатских фондовых рынках. Акцентируется внимание на макроэкономических факторах, включая политику ФРС и интервенции Банка Японии. В криптосфере обсуждаются закрытие бирж BitMart и банкротство Storj Labs, трудности компаний вроде Coinbase, а также действия MicroStrategy по наращиванию резервов. Поднимаются темы инсайдерской торговли на Hyperliquid и отключения малопопулярных активов в Aave. Отдельно выделяется энтузиазм венчурных инвесторов вокруг Bittensor ($TAO). Завершается обзор серьёзным предупреждением об уязвимости аппаратных кошельков Coldcard, призывая пользователей к немедленным действиям и повышенной бдительности при самохранении активов.

cryptonews.ru33 мин. назад

Акции компаний, занимающихся искусственным интеллектом, торгуются как «мемокоины», в то время как биткоин практически не меняет цены — обзор недели

cryptonews.ru33 мин. назад

Coinkite подвергся критике за хранение электронных писем клиентов после взлома Coldcard на сумму 88 млн долларов

Coinkite столкнулась с критикой из-за хранения электронных адресов клиентов после взлома, связанного с аппаратными кошельками Coldcard, в результате которого было похищено более 1000 BTC (свыше 88 млн долларов). Инцидент произошел из-за ошибки в генерации случайных сид-фраз. Чтобы предупредить пострадавших, компания отправила письма на адреса, связанные с покупками с 2019 года, что вызвало вопросы о хранении таких данных. Coinkite сослалась на свою политику, согласно которой электронные адреса сохраняются для возможности входа и проверки удаления остальной информации, но не указала сроки их хранения. Соучредитель компании Родольфо Новак подчеркнул, что Coinkite не хранит данные клиентов и предлагает анонимные покупки с удалением информации через 90 дней. Тем не менее, ущерб от взлома продолжает расти, достигнув к субботе 1 367 BTC.

cryptonews.ru33 мин. назад

Coinkite подвергся критике за хранение электронных писем клиентов после взлома Coldcard на сумму 88 млн долларов

cryptonews.ru33 мин. назад

Торговля

Спот
活动图片