Десятки миллионов ошибок в час: исследование раскрывает «иллюзию точности» AI-поиска Google

marsbitОпубликовано 2026-04-13Обновлено 2026-04-13

Введение

Автор: Клод, Deep Chao TechFlow Согласно совместному исследованию The New York Times и стартапа Oumi, функция AI Overviews (ИИ-сводки) в Google Search демонстрирует точность около 91%. Однако, учитывая масштаб Google (5 триллионов запросов в год), это означает, что система ежечасно генерирует десятки миллионов ошибочных ответов — более 57 миллионов. Проблема усугубляется тем, что даже когда ответ верен, более половины (56% для Gemini 3) цитируемых источников не подтверждают выводы, сделанные ИИ. Часто используются низкокачественные источники, такие как Facebook и Reddit. Еще одной серьёзной проблемой является уязвимость к манипуляциям. Тест BBC показал, что ложная информация из намеренно сфабрикованной статьи начала появляться в ответах ИИ менее чем за 24 часа. Google оспаривает методологию исследования, заявляя о «серьёзных недостатках», включая использование другого ИИ (HallOumi) для оценки и нереалистичные тестовые запросы. Внутренние тесты Google показывают, что их модель Gemini 3 вне поисковой системы имеет уровень ошибок в 28%, но компания утверждает, что интеграция с поиском значительно повышает её точность.

Автор: Клод, Deep Chao TechFlow

Глубинный обзор: Совместное тестирование The New York Times и AI-стартапа Oumi показало, что точность функции AI-анонсов (AI Overviews) в поиске Google составляет около 91%. Однако с учётом масштаба Google, обрабатывающего 5 триллионов поисковых запросов в год, это означает, что ежечасно генерируются десятки миллионов ошибочных ответов. Что ещё серьёзнее, даже при правильных ответах более половины ссылок на источники не подтверждают выводы.

Google в беспрецедентных масштабах поставляет пользователям недостоверную информацию, и большинство об этом даже не подозревает.

Согласно The New York Times, AI-стартап Oumi по её заказу провёл оценку точности функции AI Overviews от Google с использованием отраслевого стандартного теста SimpleQA, разработанного OpenAI. Тестирование охватило 4326 поисковых запросов и проводилось в два этапа: в октябре прошлого года (на движке Gemini 2) и в феврале этого года (после обновления до Gemini 3). Результаты показали, что точность Gemini 2 составила около 85%, а Gemini 3 повысила её до 91%.

91% звучит неплохо, но в масштабах Google это выглядит иначе. Google обрабатывает около 5 триллионов поисковых запросов в год. При 9% уровне ошибок AI Overviews ежечасно генерирует более 57 миллионов неточных ответов, что приближается к 1 миллиону в минуту.

Ответ верный, но источник ошибочен

Беспокойнее, чем точность, является проблема «отрыва» источников цитирования.

Данные Oumi показывают, что во времена Gemini 2 в 37% правильных ответов существовала проблема «необоснованного цитирования», когда прикреплённые к AI-анонсу ссылки не подтверждали предоставленную информацию. После обновления до Gemini 3 этот показатель не снизился, а подскочил до 56%. Иными словами, модель, давая правильные ответы, всё хуже «делает домашнюю работу».

Вопрос генерального директора Oumi Маноса Кукумидиса бьёт в самую суть: «Даже если ответ правильный, откуда ты знаешь, что он правильный? Как ты это проверишь?»

Массовое цитирование AI Overviews низкокачественных источников усугубляет эту проблему. Oumi обнаружила, что Facebook и Reddit являются вторым и четвёртым по частоте источниками цитирования для AI Overviews. Среди неточных ответов Facebook цитировался в 7% случаев, что выше, чем 5% в точных ответах.

Фальшивая статья журналиста BBC «отравила» систему за 24 часа

Ещё один серьёзный недостаток AI Overviews — чрезвычайная лёгкость манипулирования.

Один журналист BBC провёл тест с помощью намеренно сфабрикованной фальшивой статьи, и менее чем за 24 часа AI-анонс Google начал представлять содержащуюся в ней ложную информацию как факт для пользователей.

Это означает, что любой, кто понимает механизм работы системы, может «отравить» AI-результаты поиска, публикуя ложный контент и накручивая его трафик. Пресс-секретарь Google Нед Адрианс в ответ на это заявил, что AI-функция поиска построена на тех же механизмах ранжирования и безопасности, что и блокировка спама, и что «большинство примеров в тесте — это нереалистичные запросы, которые люди на самом деле не ищут».

Возражение Google: проблемы в самом тесте

Google выдвинула ряд претензий к исследованию Oumi. Пресс-секретарь компании назвал это исследование «имеющим серьёзные недостатки»,理由包括: сам эталонный тест SimpleQA содержит неточную информацию; Oumi использовала собственную AI-модель HallOumi для оценки другой AI, что могло внести дополнительную погрешность; содержание теста не отражает реальное поведение пользователей при поиске.

Внутреннее тестирование Google также показало, что при самостоятельной работе Gemini 3 вне框架 поиска Google доля ложных выводов достигает 28%. Но Google подчеркивает, что AI Overviews, используя систему поискового ранжирования, повышает точность и работает лучше, чем модель сама по себе.

Однако, как указывает PCMag, возникает логический парадокс: если ваш довод в защиту — «отчёт, указывающий на неточность нашего AI, сам использует возможно неточный AI», то это вряд ли усилит доверие пользователей к точности вашего продукта.

Связанные с этим вопросы

QКакова точность функции AI Overviews в Google Поиске по данным тестирования?

AСогласно тестированию, проведенному компанией Oumi, точность AI Overviews составляет около 91% при использовании Gemini 3.

QСколько неточных ответов в час генерирует функция AI Overviews из-за масштабов Google?

AПри годовом объеме в 5 триллионов поисковых запросов и 9% уровне ошибок, AI Overviews генерирует более 57 миллионов неточных ответов в час.

QВ чем заключается проблема «необоснованных ссылок» в ответах AI Overviews?

AПроблема «необоснованных ссылок» означает, что ссылки, прилагаемые к ответам ИИ, не подтверждают предоставленную информацию. Эта проблема возросла с 37% до 56% после обновления до Gemini 3.

QКакие платформы часто цитируются в неточных ответах AI Overviews?

AFacebook и Reddit являются вторым и четвертым по частоте источниками цитирования. В неточных ответах Facebook цитируется в 7% случаев.

QКак Google ответил на критику точности AI Overviews?

AGoogle оспорил методы тестирования, заявив, что исследование имеет «серьезные недостатки», включая использование спорного бенчмарка SimpleQA и модели HallOumi от Oumi для оценки, что могло внести дополнительные ошибки.

Похожее

Роботы-«Телепузики» приходят убираться домой за 200 рублей в час. Настоящий человеко-автомат

Американский стартап Tau Robotics представил услугу по уборке домов с помощью человекоподобных роботов по цене $30 в час. Роботы под именами Chelsea, Elon и Tony выполняют различные задачи: уборку кухни и ванной, регулярное обслуживание и глубокую чистку. Ключевая особенность — все действия в демонстрационных видео выполняются в реальном времени, без ускорения, что редкость для подобных демо. Однако выяснилось, что роботы в текущей версии не автономны, а управляются оператором дистанционно (так называемый «teleoperation»). Основатели объясняют этот подход как стратегический: он позволяет собирать данные в реальных домашних условиях для последующего обучения автономного ИИ, аналогично «режиму тени» в беспилотных автомобилях. В статье обсуждается сложность внедрения человекоподобных роботов в домашние условия. Автор отмечает, что, несмотря на критику «дистанционного управления», такой подход может быть практичным первым шагом для сбора данных. Также подчёркивается, что человекоподобная форма упрощает дистанционное управление, так как оператору интуитивно понятны движения, и она обладает значительной эмоциональной ценностью для пользователя. Услуга в настоящее время доступна по приглашению в Сан-Франциско.

marsbit14 мин. назад

Роботы-«Телепузики» приходят убираться домой за 200 рублей в час. Настоящий человеко-автомат

marsbit14 мин. назад

Из Кореи в США: благодаря ИИ рабочие профессии становятся всё востребованнее

Искусственный интеллект меняет структуру рынка труда, повышая спрос и зарплаты квалифицированных рабочих специальностей, в то время как традиционное высшее образование теряет привлекательность. Данные из США показывают, что доходы профессиональных училищ выросли на 11.4% в 2025 году, а число увольнений из-за внедрения ИИ достигло рекордных 38 579 в мае. Молодое поколение всё чаще выбирает рабочие профессии, считая их более стабильными в эпоху автоматизации. В США зарплаты таких специалистов, как электрики и сантехники, уже сравнялись или превзошли доходы многих офисных работников. В Корее выпускники профильных школ, например, полупроводниковой, практически гарантированно получают работу в таких компаниях, как Samsung. Дефицит кадров усугубляется массовым выходом на пенсию старшего поколения и бумом строительства инфраструктуры, в том числе для дата-центров. Крупные компании, такие как Meta и JPMorgan, инвестируют миллионы в программы обучения. Несмотря на растущий интерес, преодоление стереотипов о "непрестижности" рабочих профессий остаётся ключевой задачей для полного удовлетворения рыночного спроса.

marsbit58 мин. назад

Из Кореи в США: благодаря ИИ рабочие профессии становятся всё востребованнее

marsbit58 мин. назад

От TPU к самосовершенствующимся агентам: как Джефф Дин видит следующий шаг в развитии ИИ

В статье на основе выступления Джеффа Дина на YC Startup School обсуждается эволюция ИИ от больших моделей к системам с долгосрочными агентами. Дин подчеркивает, что следующий этап ИИ — не просто более умные модели, а создание систем, способных к продолжительной автономной работе, самообучению и автоматизированным экспериментам. Ключевые темы включают смещение фокуса с размера моделей на организацию интеллекта, важность контекстной инженерии, аппаратной эффективности (особенно для вывода), а также возможности для стартапов в нишевых областях, где большие модели слабы. Он отмечает, что по мере удешевления генерации кода возрастает ценность четких спецификаций, правильной постановки задач и "вкуса" в выборе направлений. В итоге, главным становится не ответ модели, а создание надежных систем, способных выполнять сложные, многошаговые задачи.

marsbit1 ч. назад

От TPU к самосовершенствующимся агентам: как Джефф Дин видит следующий шаг в развитии ИИ

marsbit1 ч. назад

Qualcomm: спад ажиотажа вокруг ИИ. Когда наступит выздоровление на рынке смартфонов?

Компания Qualcomm (QCOM.O) опубликовала финансовый отчёт за третий квартал 2026 финансового года (по состоянию на июнь 2026 года). Выручка составила 9,95 млрд долларов США, что на 4% меньше, чем годом ранее, но превысило рыночные ожидания. Однако маржинальность снизилась до 53,1%, не достигнув прогнозируемых 54,6%, главным образом из-за роста себестоимости, включая затраты на производство и память. Основное давление на выручку оказал сегмент мобильных устройств, который упал на 19,6% до 5,09 млрд долларов. Это связано со снижением глобальных поставок смартфонов (кроме Apple) на 11%, а также с тенденцией производителей использовать старые платформы для снижения затрат. В то же время автомобильный бизнес продемонстрировал рост на 61% до 1,59 млрд долларов, а сегмент IoT вырос на 9% до 1,83 млрд. Чистая прибыль составила 2 млрд долларов, однако операционная прибыль снизилась на 41% из-за падения маржинальности и роста расходов. Прогноз на следующий квартал по выручке (97-105 млрд долларов) соответствует ожиданиям, но прогноз по прибыли на акцию оказался ниже рыночных оценок. На фоне слабости основного бизнеса Qualcomm активно развивает направление центров обработки данных (ЦОД) в сфере ИИ, представив четыре продуктовые линии: ускорители ИИ, коммерческие CPU, индивидуальные чипы и решения для подключения. Компания сотрудничает с Microsoft и Meta и ставит амбициозную цель по выручке от этого направления в 15 млрд долларов к 2029 финансовому году. Однако, поскольку данный бизнес ещё не вносит существенного вклада в выручку, а ожидания рынка в отношении ИИ снижаются, акции компании откатились с пиков, достигнутых на волне энтузиазма по поводу ИИ. В краткосрочной перспективе производительность компании по-прежнему зависит от восстановления рынка смартфонов и снижения цен на компоненты, такие как память.

marsbit1 ч. назад

Qualcomm: спад ажиотажа вокруг ИИ. Когда наступит выздоровление на рынке смартфонов?

marsbit1 ч. назад

Эксплойт Coldcard вызывает исход биткойнов, «бычья» консолидация крипторынка: Дайджест Ходлера, 2 августа

После утечки средств из кошельков Coldcard на сумму около $90 млн в биткойнах, мелкие держатели стали активно переводить средства на централизованные биржи. Объём переводов менее 1 BTC достиг максимума с 2022 года. По данным Galaxy Research, в результате трёх волн атак было скомпрометировано более 4500 адресов. Эксплойт использовал уязвимость в процессе генерации сида кошелька. В США обсуждение "Закона о ясности" (Clarity Act) зашло в тупик из-за разногласий по этическим нормам для политиков и регулированию стейблкоинов. Вероятность принятия закона до истечения срока крайне мала. Отчётность компаний за второй квартал показала снижение доходов: Coinbase сообщила о чистых убытках, а доход Robinhood от криптовалютных операций упал на 38%. При этом аналитик ARK Invest заявил, что индустрия вступает в фазу крупнейшей консолидации, что, по его мнению, является бычьим сигналом. Чемпионат мира по футболу 2026 года принёс $20 млрд объёма на блокчейн-рынках прогнозов. За неделю Bitcoin и Ether потеряли около 3% стоимости. Среди альткоинов лучше всего себя показали Cardano (ADA) и Uniswap (UNI). Аналитики Grayscale предположили, что дно рынка Bitcoin, возможно, уже достигнуто раньше традиционного четырёхлетнего цикла. В разделе FUD: основатель Telegram Павел Дуров объявлен в розыск в России, платформа Pump.fun уволила сотрудников перед получением ими токенов на миллионы долларов, а сотрудник Белого дома покинул пост на фоне обвинений в использовании инсайдерской информации для ставок на прогнозных рынках.

cointelegraph1 ч. назад

Эксплойт Coldcard вызывает исход биткойнов, «бычья» консолидация крипторынка: Дайджест Ходлера, 2 августа

cointelegraph1 ч. назад

Торговля

Спот
活动图片