Hàng chục triệu lỗi mỗi giờ, cuộc điều tra tiết lộ "ảo tưởng về độ chính xác" của công cụ tìm kiếm AI Google

marsbitXuất bản vào 2026-04-10Cập nhật gần nhất vào 2026-04-10

Tóm tắt

Theo một nghiên cứu do The New York Times ủy quyền và thực hiện bởi công ty AI Oumi, tính năng AI Overviews (Tổng quan AI) của Google có tỷ lệ chính xác khoảng 91%. Tuy nhiên, với quy mô xử lý khoảng 5 nghìn tỷ lượt tìm kiếm mỗi năm của Google, tỷ lệ lỗi 9% này đồng nghĩa với việc mỗi giờ có thể phát sinh hơn 57 triệu câu trả lời không chính xác. Một vấn đề nghiêm trọng hơn là các trích dẫn nguồn không đáng tin cậy. Dữ liệu cho thấy 56% câu trả lời đúng của Gemini 3 (phiên bản nâng cấp) đi kèm với các liên kết tham khảo không hỗ trợ cho thông tin được đưa ra. Các nguồn chất lượng thấp như Facebook và Reddit thường xuyên được trích dẫn. Ngoài ra, tính năng này dễ bị thao túng. Một phóng viên BBC đã thử nghiệm bằng một bài báo giả mạo và thông tin sai lệch xuất hiện trong kết quả AI Overviews chưa đầy 24 giờ sau đó. Google phản bác nghiên cứu, cho rằng phương pháp kiểm tra có "những lỗ hổng nghiêm trọng", bao gồm việc sử dụng một mô hình AI khác để đánh giá và các truy vấn thử nghiệm không phản ánh hành vi tìm kiếm thực tế.

Tác giả: Claude, Deep Tide TechFlow

Deep Tide导读: Bài kiểm tra mới nhất của The New York Times phối hợp với công ty khởi nghiệp AI Oumi cho thấy, tính năng Tóm tắt AI (AI Overviews) của Google Tìm kiếm có độ chính xác khoảng 91%, nhưng với quy mô xử lý 5 nghìn tỷ lượt tìm kiếm mỗi năm của Google, điều này đồng nghĩa với việc mỗi giờ tạo ra hàng chục triệu câu trả lời sai. Đáng lo ngại hơn, ngay cả khi câu trả lời đúng, hơn một nửa các liên kết trích dẫn không thể hỗ trợ kết luận của nó.

Google đang cung cấp thông tin sai lệch cho người dùng trên quy mô chưa từng có, và hầu hết mọi người không hề hay biết.

Theo The New York Times, công ty khởi nghiệp AI Oumi được họ ủy quyền đã sử dụng bài kiểm tra tiêu chuẩn ngành SimpleQA do OpenAI phát triển để đánh giá độ chính xác của tính năng AI Overviews của Google. Bài kiểm tra bao gồm 4326 truy vấn tìm kiếm, được thực hiện vào tháng 10 năm ngoái (do Gemini 2 cung cấp) và một lần nữa vào tháng 2 năm nay (sau khi nâng cấp lên Gemini 3). Kết quả cho thấy, độ chính xác của Gemini 2 là khoảng 85%, và Gemini 3 đã tăng lên 91%.

91% nghe có vẻ tốt, nhưng đặt trong quy mô của Google thì đó là chuyện khác. Google xử lý khoảng 5 nghìn tỷ truy vấn tìm kiếm mỗi năm, tính theo tỷ lệ sai sót 9%, AI Overviews tạo ra hơn 57 triệu câu trả lời không chính xác mỗi giờ, gần 1 triệu câu mỗi phút.

Câu trả lời đúng, nhưng nguồn lại sai

Đáng lo ngại hơn cả tỷ lệ chính xác là vấn đề "trích dẫn không có căn cứ".

Dữ liệu từ Oumi cho thấy, ở thời Gemini 2, 37% câu trả lời đúng tồn tại vấn đề "trích dẫn không có cơ sở", tức là các liên kết đính kèm trong phần tóm tắt AI không hỗ trợ thông tin mà nó đưa ra. Sau khi nâng cấp lên Gemini 3, tỷ lệ này không những không giảm mà còn tăng vọt lên 56%. Nói cách khác, trong khi đưa ra câu trả lời đúng, mô hình ngày càng không biết "nộp bài tập về nhà".

Câu hỏi của CEO Oumi Manos Koukoumidis đã chỉ ra trọng điểm: "Ngay cả khi câu trả lời là đúng, làm sao bạn biết nó đúng? Làm thế nào để bạn xác minh?"

Việc AI Overviews trích dẫn một lượng lớn các nguồn chất lượng thấp càng làm trầm trọng thêm vấn đề này. Oumi phát hiện ra rằng Facebook và Reddit lần lượt là nguồn trích dẫn lớn thứ hai và thứ tư của AI Overviews. Trong các câu trả lời không chính xác, tần suất trích dẫn Facebook là 7%, cao hơn so với 5% trong các câu trả lời chính xác.

Một bài báo giả của phóng viên BBC, "đầu độc" thành công trong vòng 24 giờ

Một điểm yếu nghiêm trọng khác của AI Overviews là rất dễ bị thao túng.

Một phóng viên BBC đã sử dụng một bài báo giả mạo được cố tình bịa đặt để kiểm tra, chưa đầy 24 giờ sau, phần tóm tắt AI của Google đã trình bày thông tin sai lệch trong đó như một sự thật cho người dùng.

Điều này có nghĩa là bất kỳ ai hiểu rõ cơ chế hoạt động của hệ thống đều có thể "đầu độc" kết quả tìm kiếm AI bằng cách xuất bản nội dung giả mạo và đẩy cao lưu lượng truy cập của nó. Phản hồi của phát ngôn viên Google Ned Adriance về vấn đề này là, chức năng AI tìm kiếm được xây dựng dựa trên cùng cơ chế xếp hạng và bảo mật để chặn thông tin rác, và ông cho rằng "hầu hết các ví dụ trong bài kiểm tra là những truy vấn không thực tế mà mọi người thực tế sẽ không tìm kiếm".

Google phản bác: Chính bài kiểm tra có vấn đề

Google đã đặt ra nhiều nghi vấn về nghiên cứu của Oumi. Phát ngôn viên của Google cho biết nghiên cứu này "có những lỗ hổng nghiêm trọng", lý do bao gồm: bản thân bài kiểm tra chuẩn SimpleQA chứa thông tin không chính xác; Oumi sử dụng mô hình AI riêng HallOumi của họ để đánh giá hiệu suất của một AI khác, có thể gây ra sai số bổ sung; nội dung kiểm tra không phản ánh hành vi tìm kiếm thực tế của người dùng.

Bài kiểm tra nội bộ của Google cũng cho thấy, khi Gemini 3 hoạt động độc lập ngoài khuôn khổ Tìm kiếm của Google, tỷ lệ tạo ra đầu ra sai lệch lên tới 28%. Nhưng Google nhấn mạnh, AI Overviews sử dụng hệ thống xếp hạng tìm kiếm để nâng cao độ chính xác, thể hiện tốt hơn chính mô hình.

Tuy nhiên, như nhận xét của PCMag đã chỉ ra nghịch lý logic: Nếu lý do biện hộ của bạn là "chỉ ra rằng báo cáo về sự không chính xác của AI chúng tôi bản thân nó cũng sử dụng AI có thể không chính xác", điều này e rằng không thể tăng cường sự tin tưởng của người dùng vào độ chính xác sản phẩm của bạn.

Câu hỏi Liên quan

QTỷ lệ chính xác của tính năng AI Overviews của Google là bao nhiêu theo nghiên cứu của Oumi?

ATheo nghiên cứu của Oumi, tỷ lệ chính xác của AI Overviews là khoảng 91% khi sử dụng Gemini 3, tăng từ 85% so với Gemini 2.

QVới quy mô của Google, ước tính có bao nhiêu câu trả lời không chính xác được tạo ra mỗi giờ?

AVới 5 nghìn tỷ lượt tìm kiếm mỗi năm và tỷ lệ lỗi 9%, AI Overviews ước tính tạo ra hơn 57 triệu câu trả lời không chính xác mỗi giờ.

QVấn đề 'trích dẫn không có cơ sở' trong các câu trả lời đúng của AI Overviews là gì?

AĐây là vấn đề khi câu trả lời của AI là đúng, nhưng các liên kết trích dẫn kèm theo lại không hỗ trợ hoặc chứng minh cho thông tin đó. Tỷ lệ này tăng từ 37% lên 56% sau khi nâng cấp lên Gemini 3.

QNguồn trích dẫn nào của AI Overviews được coi là có chất lượng thấp?

ANghiên cứu chỉ ra rằng Facebook và Reddit lần lượt là nguồn trích dẫn lớn thứ hai và thứ tư của AI Overviews, và chúng thường xuyên xuất hiện trong các câu trả lời không chính xác.

QGoogle đã phản bác lại nghiên cứu của Oumi như thế nào?

AGoogle cho rằng nghiên cứu của Oumi 'có những lỗ hổng nghiêm trọng', bao gồm việc sử dụng bộ kiểm tra SimpleQA vốn chứa thông tin không chính xác, sử dụng mô hình AI của chính họ (HallOumi) để đánh giá, và các truy vấn thử nghiệm không phản ánh hành vi tìm kiếm thực tế của người dùng.

Nội dung Liên quan

LayerZero Lên Tiếng Về Vụ Khai Thác Tiền Mã Hóa KelpDAO 290 Triệu USD

Vụ khai thác 290 triệu USD của KelpDAO đã bước sang giai đoạn mới, với LayerZero và Aave công khai giải thích nguyên nhân, khẳng định thiệt hại đã được kiểm soát. LayerZero tuyên bố lỗi không nằm ở giao thức mà do KelpDAO vận hành rsETH với cấu hình xác thực đơn (single-DVN). Sự cố được cho là do một tổ chức nhà nước tinh vi, có khả năng là Lazarus Group của Triều Tiên, thực hiện tấn công vào cơ sở hạ tầng RPC. LayerZero nhấn mạnh cấu hình đa DVN được khuyến nghị đã có thể ngăn chặn cuộc tấn công này. Hiện DVN của họ đã hoạt động trở lại, các nút RPC bị ảnh hưởng đã được thay thế. Aave cho biết rsETH trên Ethereum mainnet vẫn được đảm bảo đầy đủ nhưng vẫn tạm ngừng giao dịch do thận trọng.

bitcoinist6 phút trước

LayerZero Lên Tiếng Về Vụ Khai Thác Tiền Mã Hóa KelpDAO 290 Triệu USD

bitcoinist6 phút trước

Niềm Tin Của Nhà Đầu Tư Vào Ozak AI Tiếp Tục Tăng Bất Chấp Sự Bất Ổn Rộng Khắp Thị Trường Tiền Điện Tử

Mặc dù thị trường tiền điện tử đang trong giai đoạn bất ổn với sự điều chỉnh của Bitcoin và Ethereum, niềm tin của nhà đầu tư vào Ozak AI ($OZ) vẫn tiếp tục tăng. Dự án này kết hợp trí tuệ nhân tạo (AI) và mạng lưới cơ sở hạ tầng vật lý phi tập trung (DePIN), huy động thành công hơn 6 triệu USD trong đợt presale với giá hiện tại là 0,014 USD. Sự tự tin của nhà đầu tư đến từ tiện ích thực tế của dự án, bao gồm tự động hóa, phân tích dự báo và hỗ trợ đa chuỗi, cùng các đối tác chiến lược như SINT, Hive Intel và Pyth Network. Ozak AI được đánh giá cao nhờ cơ sở hạ tầng có khả năng mở rộng, tiềm năng tăng trưởng lâu dài và định vị vững chắc trong hệ sinh thái crypto, thu hút dòng tiền ổn định bất chấp điều kiện thị trường hiện tại.

TheNewsCrypto26 phút trước

Niềm Tin Của Nhà Đầu Tư Vào Ozak AI Tiếp Tục Tăng Bất Chấp Sự Bất Ổn Rộng Khắp Thị Trường Tiền Điện Tử

TheNewsCrypto26 phút trước

Unicoin Foundation Ra Mắt, Kết Hợp Tác Động Xã Hội với Tương Lai của Crypto Có Trách Nhiệm

Quỹ Unicoin chính thức ra mắt với sứ mệnh kết hợp tác động xã hội và tương lai của tiền điện tử có trách nhiệm. Tổ chức này tập trung vào giáo dục tài chính, thúc đẩy tinh thần kinh doanh và mở rộng tiếp cận kinh tế số cho cộng đồng thiệt thòi thông qua sáng kiến "Crypto for Good". Quỹ hoạt động độc lập với Unicoin Inc., tuân thủ nguyên tắc minh bạch và quản trị rõ ràng, phù hợp với khuôn khổ pháp lý của SEC. Hơn 4.000 cổ đông đã bỏ phiếu chấp thuận thành lập quỹ với tỷ lệ ủng hộ gần 99%. Các sáng lập viên Silvina Moschini và Alex Konanykhin nhấn mạnh mục tiêu xây dựng tương lai tiền điện tử dựa trên giáo dục, niềm tin và tác động thực tế, đồng thời mở rộng cơ hội kinh tế số toàn cầu một cách công bằng và minh bạch.

TheNewsCrypto1 giờ trước

Unicoin Foundation Ra Mắt, Kết Hợp Tác Động Xã Hội với Tương Lai của Crypto Có Trách Nhiệm

TheNewsCrypto1 giờ trước

Giá Bitcoin Có Thể Chứng Kiến Một Đợt Sụp Đổ Khác, Nhưng Triển Vọng Dài Hạn Là Gì?

Giá Bitcoin đã vượt qua 78.000 USD, kích hoạt tâm lý lạc quan trên thị trường, nhưng nhà phân tích Behdark cảnh báo về khả năng giảm mạnh trước khi phục hồi. Ông cho rằng đà tăng hiện tại có thể là chiến thuật của các "market maker" để thu hút nhà đầu tư trước khi bán tháo. Cấu trúc kỹ thuật của Bitcoin đang hình thành mô hình tam giác hoặc diamagnetic, dự báo xu hướng giảm trước khi tăng trở lại. Các mức kháng cự quan trọng cần theo dõi là 77.000 USD và 80.552 USD - nơi áp lực bán có thể xuất hiện. Nếu giá giảm, các hỗ trợ đầu tiên là 72.800 USD và 67.885 USD. Vi phạm mức 67.885 USD có thể kéo giá giảm thêm 10%, với hỗ trợ mạnh ở 67.677 USD (vẫn cao hơn ngưỡng chu kỳ 60.000 USD). Nhà đầu tư nên theo dõi các điểm này để tìm cơ hội mua vào ở vùng giá thấp hơn.

bitcoinist2 giờ trước

Giá Bitcoin Có Thể Chứng Kiến Một Đợt Sụp Đổ Khác, Nhưng Triển Vọng Dài Hạn Là Gì?

bitcoinist2 giờ trước

Thị Trường Dự Đoán Dưới Góc Nhìn Định Kiến

Thị trường dự đoán thường bị gán nhãn cờ bạc, nhưng thực chất là công cụ tài chính cho phép cá nhân chủ động dự báo sự thật và chuyển giao rủi ro. Khác biệt giữa đầu tư và cờ bạc nằm ở chiến lược của người tham gia, không phải bản chất thị trường. Thị trường dự đoán hoạt động dựa trên tính chính xác và kỳ hạn hữu hạn, giúp định giá thông tin khách quan, loại bỏ yếu tố nhiễu. Dù bị chỉ trích do lo ngại nội gián và cờ bạc hóa, thị trường này thực chất tưởng thưởng cho người có lợi thế thông tin chân chính, đồng thời tạo cơ chế phòng ngừa rủi ro minh bạch. Sự phản đối từ truyền thông chính thống thường xuất phát từ động cơ kiểm soát thông tin, trong khi thị trường dự đoán thúc đẩy dân chủ hóa tri thức và bảo vệ quyền tiếp cận sự thật công bằng.

marsbit2 giờ trước

Thị Trường Dự Đoán Dưới Góc Nhìn Định Kiến