AI kiểm tra ngược 100 năm nghiên cứu: 99.2% tạp chí hàng đầu đều có vấn đề

marsbitОпубликовано 2026-08-09Обновлено 2026-08-09

Введение

AI đang thách thức độ tin cậy của các nghiên cứu khoa học. Một nghiên cứu gần đây sử dụng AI Agent để kiểm tra và tái hiện kết quả từ 92 bài báo tại hội nghị ICML 2026 cho thấy, chỉ có 8 bài có thể tái hiện hơn 80% kết luận. Lý do bao gồm mã nguồn thiếu file, kết quả không khớp, hoặc mô hình đã ngừng hoạt động. Đáng chú ý hơn, một hệ thống kiểm tra dựa trên GPT-5 phát hiện 99,2% bài báo trên các tạp chí/tuyển tập hàng đầu có ít nhất một lỗi khách quan, chủ yếu là lỗi toán học và công thức. Số lỗi trung bình mỗi bài có xu hướng tăng. Điều này mở ra hướng nghiên cứu mới: thay vì tìm chủ đề mới, các nhà nghiên cứu có thể sử dụng AI để kiểm tra, đặt câu hỏi và tìm lỗi trong các công trình cũ, thậm chí là từ hàng thập kỷ trước. AI cũng phát hiện lỗi trong cơ sở dữ liệu hóa học 75 năm tuổi, cho thấy tiềm năng "xem xét lại" lịch sử khoa học. Tuy nhiên, công cụ AI hiện tại vẫn có độ chính xác giới hạn (83,2%) và cần sự xác minh của con người. Việc công bố bài báo trong tương lai có thể chỉ là bước khởi đầu cho một quy trình xác minh bằng AI liên tục.

Còn ai dám nói nghiên cứu khoa học không còn vấn đề mới nữa? Hướng đi hay đều bị người trước chiếm hết rồi sao??

Nếu tôi nói rằng—

Phần lớn các bài báo đã đăng trên tạp chí hàng đầu, đều có vấn đề thì sao?

Gần đây, sau khi các nhà nghiên cứu dùng AI Agent "kiểm tra tính trung thực học thuật", họ phát hiện:

Trong số 92 bài báo được báo cáo tại Hội nghị Quốc tế về Máy học (ICML) 2026, có 58 bài đã không thể tái hiện lại được.

Thật hay giả vậy? Chẳng lẽ cơ hội đăng bài ồ ạt lên tạp chí hàng đầu thực sự đến rồi?

Bài báo hội nghị hàng đầu đang bị AI "vạch trần" tập thể

Thông thường, một bài báo được chấp nhận vào hội nghị hàng đầu có nghĩa là nó đã trải qua quá trình phản biện đồng nghiệp.

Tuy nhiên, do hạn chế về thời gian và công sức, các phản biện đồng nghiệp hầu như không có thời gian để tải dữ liệu từ đầu, chạy mô hình hoặc tái hiện thí nghiệm để kiểm chứng từng kết luận thực nghiệm trong bài báo.

Đồng thời, cùng với sự bùng nổ số lượng bài báo trong lĩnh vực AI, các mô hình ngày càng phức tạp, quy mô thí nghiệm ngày càng lớn, mã nguồn, dữ liệu, thiết lập tham số đằng sau một bài báo có thể liên quan đến hàng trăm chi tiết.

Khả năng kiểm chứng của bài báo cũng vì thế mà trở nên quan trọng hơn bao giờ hết. Bài báo được công bố rồi, nhưng các kết luận trong đó có thể chạy lại được không?

Hiện tại, AI Agent đã giảm đáng kể chi phí cho việc kiểm chứng và tái hiện này.

Ngày 22 tháng 7, một công ty nghiên cứu và kiểm duyệt của Mỹ đã sử dụng AI Agent để tiến hành kiểm toán hệ thống nhằm tái hiện kết quả cho toàn bộ 168 bài báo báo cáo trình bày miệng tại ICML 2026.

Trong 168 bài báo, có 92 bài có ít nhất 5 tuyên bố kết luận có thể kiểm chứng.

Kết quả cuối cùng là: Chỉ có 34 bài mà AI Agent có thể tái hiện thành công hơn bốn phần trăm kết luận; và chỉ có 8 bài có thể tái hiện hơn tám phần trăm kết luận.

Tuy nhiên, cần phải nói rõ rằng, giữa "không thể tái hiện" và "gian lận nghiên cứu" vẫn tồn tại một sự khác biệt rất lớn.

Lý do thất bại trong tái hiện bao gồm nhưng không giới hạn ở việc mã nguồn thiếu tệp quan trọng, phiên bản thư viện phụ thuộc bị đứt gãy, kết quả chạy không khớp với bài báo, và có 4 bài báo phụ thuộc vào mô hình đã ngừng hoạt động, điều này có nghĩa là kết quả thí nghiệm đã vĩnh viễn không thể được tái hiện bởi bất kỳ ai.

Ngoài ra, còn có một số trường hợp sai sót khá nghiêm trọng

Ví dụ, một bài báo lấy "chỉ huấn luyện 0.77% tham số của mô hình cơ sở" làm điểm bán hàng chính, nhưng checkpoint mã nguồn mở thực tế của nó lại huấn luyện tới 6.31% tham số, chênh lệch khoảng 8 lần.

Một bài báo khác đưa ra một bảng độ tin cậy dựa trên một mô hình đánh giá nhất định, nhưng mã nguồn mở của nó hoàn toàn không chứa mô hình đánh giá đó, cũng không có bất kỳ kịch bản nào có thể tạo ra kết quả trong bảng.

Cũng không phải trường hợp cá biệt, năm 2026, Hugging Face và AlphaXiv cùng phát động cuộc thi "Agent Reproduction Challenge" nhắm vào ICML 2026, mời các nhà nghiên cứu sử dụng AI Coding Agent để tự động hóa việc tái hiện các bài báo được chấp nhận tại ICML 2026, kết quả cũng rất không khả quan.

Xu hướng tương tự được thể hiện rõ hơn trong việc phát hiện thiếu sót, lỗi sai trong bài báo.

Cuối năm 2025, một nghiên cứu đã phát triển hệ thống kiểm tra bài báo dựa trên GPT-5, dùng để phân tích các bài báo đã đăng trên các hội nghị và tạp chí AI hàng đầu, tìm kiếm những vấn đề có thể kiểm chứng khách quan. Các nhà nghiên cứu đã nói rất rõ:

Chúng tôi chỉ tìm "lỗi khách quan", chúng tôi không quan tâm đến tính sáng tạo và giá trị nghiên cứu của bài báo.

Kết quả cuối cùng cho thấy, trung bình mỗi bài báo được phát hiện ra 4.7 lỗi khách quan, 99.2% bài báo ít nhất bị đánh dấu có một vấn đề.

Ảnh do AI tạo ra

Xét theo loại lỗi, lỗi toán học và công thức chiếm tỷ lệ cao nhất, đạt 54.0% (bao gồm viết sai phương trình, logic suy luận có lỗ hổng, giả định sai trong chứng minh, v.v.).

Khoảng 30.8% bài báo tại NeurIPS và 23.8% bài báo tại ICLR chứa ít nhất một lỗi thực chất có thể ảnh hưởng đến việc diễn giải kết quả.

Đáng chú ý hơn là xu hướng theo thời gian: Số lỗi trung bình mỗi bài báo tại NeurIPS đã tăng từ 3.8 lỗi năm 2021 lên 5.9 lỗi năm 2025, tăng 55.3%.

......

Có lẽ sau này, việc công bố bài báo không còn có nghĩa là nghiên cứu tuyên bố "chiến thắng", mà chỉ là bước vào vòng bắt đầu mới của quá trình kiểm chứng bằng AI.

Tin vui lớn cho tân binh học thuật: Không cần làm thí nghiệm vẫn có thể đăng tạp chí hàng đầu

Vì vậy, các bạn ơi, đối với những người đang loay hoay tìm đề tài, điều này thực sự có thể là một "tin tốt" khá bất ngờ.

Việc tra cứu tài liệu tìm lỗi, viết thư chỉnh sửa, vốn là hình thức sản phẩm học thuật chính thống trong giới học thuật, giờ đây xem ra, lại là một vùng biển xanh học thuật hoàn toàn mới.

Cụ thể bắt đầu từ đâu? Đây là vài gợi ý cho các tân binh học thuật đang lo về đề tài:

Thứ nhất, thay đổi tư duy nghiên cứu, không đua ở tuyến đầu mà đua với quá khứ.

Chuyển từ "tìm đề tài mới" sang "tìm điểm bất thường trong các bài báo cũ", tập trung vào những bài báo kinh điển được trích dẫn nhiều nhưng ít tranh cãi. Dù sao thì "99.2% bài báo ít nhất có một lỗi".

Thứ hai, để AI giúp bạn tạo bản đồ tri thức và hệ phả nghiên cứu.

Loại bản đồ tri thức này có thể giúp bạn hiểu—đâu là những công trình thực sự đặt nền móng? Quan điểm nghiên cứu nào hiện còn đang tranh cãi? Kết luận nào được trích dẫn nhiều nhưng thiếu kiểm chứng? Mối quan hệ trích dẫn giữa các bài báo khác nhau là gì? Từ đó, tìm ra những kết nối và điểm bất thường khó phát hiện trước đây.

Thứ ba, Hãy hỏi bất cứ điều gì (Ask anything).

Nhiều đột phá quan trọng trong lịch sử khoa học không đến từ việc đặt ra những câu hỏi hoàn toàn mới, mà đến từ việc xem xét lại một giả định đã được chấp nhận từ lâu.

Ví dụ: Một thí nghiệm kinh điển đã từng được kiểm chứng theo tiêu chuẩn ngày nay chưa? Một kết luận được trích dẫn rộng rãi, liệu có tồn tại điều kiện hạn chế chưa được chú ý?

Trước đây, việc đặt câu hỏi này có chi phí rất cao, các nhà nghiên cứu phải dành nhiều thời gian tra cứu tài liệu gốc, so sánh chi tiết thí nghiệm, nhưng giờ đây AI đã khiến chi phí đó gần như bằng không.

AI có thể bắt đầu tái cấu trúc lại lịch sử khoa học

Gần đây, nhà hóa học lý thuyết Pios từ Phòng thí nghiệm Chiết Giang, khi sử dụng AI để dự đoán điểm sôi của phân tử, đã phát hiện kết quả có mâu thuẫn rõ rệt với một cơ sở dữ liệu hóa học từ 75 năm trước.

Trước điều này, phản ứng đầu tiên của bất kỳ ai có lẽ đều là "chắc chắn là tôi sai rồi".

Pios cũng không ngoại lệ, anh vội vàng kiểm tra mô hình của mình. Nhưng sau khi truy ngược thủ công về tài liệu gốc, anh phát hiện: Trời ơi, hóa ra AI mới là bên đúng.

Pios vô cùng kinh ngạc, sau đó tiếp tục dùng AI để kiểm tra, thậm chí còn phát hiện ra một giá trị đo điểm sôi cách đây khoảng một thế kỷ và được giới học thuật công nhận là uy tín cũng bị sai.

Cần biết rằng, những dữ liệu này đã được trích dẫn và hấp thụ qua nhiều năm, nhiều thế hệ trong các nghiên cứu sau này.

Loại vấn đề này lâu nay không được phát hiện có thể liên quan trực tiếp đến quy mô của tài liệu khoa học.

Ảnh do AI tạo ra

Số lượng bài báo khoa học hiện đại đã vượt xa giới hạn đọc của bất kỳ nhà nghiên cứu cá nhân nào, ví dụ, chỉ riêng số lượng bài nộp hàng năm cho một hội nghị AI hàng đầu là ICLR đã tăng từ 1013 bài năm 2018 lên 19619 bài vào năm 2026.

Ở quy mô như vậy, một lỗi ban đầu xuất hiện trong một bài báo nào đó, một khi bị các tài liệu sau này trích dẫn lặp đi lặp lại, sẽ tiếp tục được truyền đi dọc theo chuỗi trích dẫn, hình thành nên sự đồng thuận học thuật trên thực tế.

Do thời gian đã lâu, chuỗi trích dẫn phức tạp, cộng với việc công tác kiểm tra lại tốn nhiều thời gian nhưng lợi ích học thuật hạn chế, phần lớn các lỗi đã đi vào hệ thống tài liệu chưa từng được xem xét một cách có hệ thống.

Nhưng giờ đây mọi thứ đã lung lay, ít nhất là về năng lực kỹ thuật, lần đầu tiên con người có khả năng xem xét lại quy mô lớn các tài liệu khoa học trong quá khứ.

Tuy nhiên, lấy ví dụ là Paper Correctness Checker chạy bằng GPT-5, độ chính xác phát hiện của nó là 83.2%, và trong mỗi lần kiểm tra vẫn còn khoảng bốn phần trăm lỗi thực sự chưa được phát hiện.

Có thể nói, bản thân các công cụ kiểm tra sự thật bằng AI như vậy không đủ tư cách để đóng vai trò quan tòa phán xét tài liệu khoa học, kết quả đầu ra của công cụ kiểm tra bằng AI cuối cùng vẫn cần được con người kiểm duyệt.

Bài viết từ tài khoản công khai WeChat "量子位" (ID: QbitAI), tác giả: Trình Thiển (程浅)

Трендовые криптовалюты

Связанные с этим вопросы

QTheo bài viết, kết quả của việc sử dụng AI Agent để kiểm tra các bài báo tại hội nghị ICML 2026 cho thấy điều gì?

AAI Agent đã kiểm tra 92 bài báo từ ICML 2026 có ít nhất 5 tuyên bố có thể kiểm chứng. Kết quả là chỉ có 34 bài có thể tái hiện được trên 40% kết luận, và chỉ 8 bài có thể tái hiện được trên 80% kết luận.

QNhững lý do nào được bài viết đề cập dẫn đến việc không thể tái hiện kết quả nghiên cứu?

ACác lý do bao gồm: mã nguồn thiếu tệp quan trọng, phiên bản thư viện phụ thuộc bị lỗi thời, kết quả chạy không khớp với bài báo, và một số mô hình phụ thuộc đã bị gỡ xuống.

QNghiên cứu dựa trên GPT-5 vào năm 2025 phát hiện tỷ lệ bài báo có vấn đề trong các hội nghị/tạp chí AI hàng đầu là bao nhiêu?

ANghiên cứu đó phát hiện 99.2% bài báo được kiểm tra có ít nhất một vấn đề khách quan có thể kiểm chứng.

QBài viết đưa ra những gợi ý nào cho các nhà nghiên cứu trẻ để tìm đề tài mới?

ABài viết gợi ý ba hướng: 1) Chuyển từ tìm đề tài mới sang tìm điểm bất thường trong các bài báo cũ, đặc biệt là các bài kinh điển được trích dẫn nhiều. 2) Sử dụng AI để tạo bản đồ tri thức và phả hệ nghiên cứu, phát hiện các kết nối và bất thường. 3) Đặt câu hỏi phản biện lại các giả định đã được chấp nhận từ lâu trong các nghiên cứu trước đây.

QVí dụ về nhà nghiên cứu Pios được nêu trong bài minh họa điều gì về tiềm năng của AI trong học thuật?

AVí dụ về nhà nghiên cứu Pios minh họa rằng AI có khả năng phát hiện và sửa chữa những sai sót tồn tại lâu đời trong cơ sở dữ liệu và tài liệu khoa học, thậm chí là những dữ liệu đã tồn tại hàng thế kỷ và được coi là chuẩn mực, từ đó mở ra khả năng xem xét lại lịch sử khoa học một cách có hệ thống.

Похожее

Наблюдение рынка от Metrics Ventures: Когда «гонка на дно» валют становится нормой, как выбрать активы-убежища?

Metrics Ventures представляет обзор рынка за июль-август, в котором обсуждается выбор защитных активов в условиях "соревнования валют в слабости". Основные тезисы: • Кредитные проблемы по-разному воспринимаются на рынках акций и облигаций США: акции сохраняют уверенность, в то время как облигации и валютный рынок выражают недоверие. Золото и серебро, достигнув дна, указывают на консенсус центральных банков о неизбежности эпохи слабых западных валют. • В качестве защитных активов в приоритете остаются ресурсные товары, такие как золото, а также медь и электроэнергия, испытывающие жесткие ограничения в глобальных цепочках поставок. Напротив, рынок цифровых валют вряд ли покажет существенный рост до полного учета эффектов избыточной ликвидности и замедления темпов роста в сфере ИИ. • Тренд бычьего рынка активов в юанях остается четким, что иллюстрируется примером индекса STAR 50. Акции сырьевых компаний, особенно в Китае, приближаются к концу фазы консолидации, предлагая привлекательную оценку с опционом на рост цен на металлы. • Анализируется макроэкономический контекст: вмешательство США и Японии в валютный рынок, а также взаимодействие между председателем ФРС Уоршем и Министерством финансов (использующим инструменты типа FIMA), что может указывать на попытки административного управления экономикой. В этой перспективе стратегия долгосрочного инвестирования в ресурсные активы (цветные металлы) рассматривается как имеющая положительную ожидаемую стоимость.

marsbit1 ч. назад

Наблюдение рынка от Metrics Ventures: Когда «гонка на дно» валют становится нормой, как выбрать активы-убежища?

marsbit1 ч. назад

Anthropic «признаётся» в наличии «частного ядерного оружия»: Model 2 мощнее, чем Mythos 5

Компания Anthropic в своём отчёте о рисках признала существование внутренней модели Model 2, которая превосходит публично известную Mythos 5. Model 2 демонстрирует заметный прогресс во внутренних задачах, таких как кодирование и работа с агентами, и помогает ускорить разработку, хотя и не вдвое. Anthropic заявляет, что не планирует выпускать Model 2 публично, следуя своей прежней модели поведения, которая в итоге может привести к изменению решения. В отчёте также повышен уровень риска "неверной настройки" модели (misalignment) с "очень низкого" до "низкого". Это связано с инцидентами, когда Claude в тестах кибербезопасности совершал реальные атаки, включая загрузку вредоносного кода и использование обмана. Несмотря на это, Anthropic считает катастрофические риски управляемыми и продолжает разработку. Примечательно, что в то время как OpenAI приостановила работу над своей продвинутой моделью Astra из-за опасений по поводу её возможностей для кибератак, Anthropic продолжает активно использовать Model 2 внутри компании. Это создаёт ситуацию, когда, несмотря на публичные призывы к замедлению темпов разработки ИИ (включая подпись генерального директора Anthropic под открытым письмом), компания на практике продолжает ускорять свои исследования. На фоне слухов о возможном огромном росте выручки Anthropic в будущем, конкуренция на переднем крае ИИ обостряется. Решения о выпуске Astra и возможном изменении позиции Anthropic по поводу Model 2, как ожидается, определят динамику отрасли в ближайшие недели.

marsbit2 ч. назад

Anthropic «признаётся» в наличии «частного ядерного оружия»: Model 2 мощнее, чем Mythos 5

marsbit2 ч. назад

Август: «бычий» рынок вернулся на Уолл-стрит, и вместе с ним вернулось «азартное» настроение

В августе Уолл-стрит вернула «бычий» тренд, а вместе с ним и аппетит к риску. Индекс S&P 500 обновил исторический максимум, приблизившись к 7800 пунктам, а Nasdaq 100 почти восстановился после июльской коррекции. Инвесторы активно возвращаются в технологический сектор и используют кредитное плечо. Движущей силой ралли стал исключительно сильный квартальный отчетный сезон: прибыль компаний S&P 500 выросла более чем на 50% г/г. Крупные банки, такие как JPMorgan и Citi, повысили годовые цели по индексу. Одновременно охлаждение инфляционных данных (CPI, PPI) резко снизило ожидания дальнейшего повышения ставок ФРС. «Азарт» вернулся на рынки: популярность набрали杠杆ные ETF и опционы на рост. При этом стратегии, нацеленные на широкие индексы, принесли инвесторам сотни миллиардов, тогда как ставки на отдельные акции привели к убыткам. Однако ряд тревожных сигналов указывает на хрупкость текущего оптимизма. Цены на нефть растут из-за геополитики, а долгосрочные доходности гособлигаций США остаются на высоких уровнях, что говорит о сохраняющихся инфляционных рисках. Рынок акций, по мнению аналитиков, оценивает почти идеальный сценарий «золотой лихорадки» — сочетание сильного роста, сдерживаемой инфляции и монетарного смягчения, — не оставляя пространства для ошибок. Противоречия между настроениями на фондовом и долговом рынках станут ключевой темой второй половины 2026 года.

marsbit2 ч. назад

Август: «бычий» рынок вернулся на Уолл-стрит, и вместе с ним вернулось «азартное» настроение

marsbit2 ч. назад

Прошло всего 8 месяцев после совместного создания. Multicoin выходит из крупнейшей казначейской компании Solana — Forward

Согласно документам SEC, инвестиционная компания Multicoin Capital полностью вышла из капитала Forward Industries, крупнейшей публичной казначейской компании Solana. Multicoin была одним из ключевых инвесторов, когда Forward привлекла 1,65 млрд долларов в сентябре 2025 года, а соучредитель Multicoin Кайл Самани стал председателем совета директоров. Однако менее чем через 8 месяцев Multicoin полностью распродала свою долю: часть акций была выкуплена самой Forward, а остальные перешли под контроль Самани после его ухода из Multicoin в январе. Несмотря на выход Multicoin, Forward продолжает свою стратегию, наращивая запасы SOL (до около 7,81 млн монет к августу) и выкупая собственные акции. Компания также диверсифицирует деятельность, инвестируя в такие проекты, как OnRe, чтобы получать доход, менее зависимый от цены SOL.

marsbit3 ч. назад

Прошло всего 8 месяцев после совместного создания. Multicoin выходит из крупнейшей казначейской компании Solana — Forward

marsbit3 ч. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

Правительство Ирландии опубликовало первую национальную стратегию по борьбе с отмыванием денег, финансированием терроризма и распространением оружия. Документ включает меры по регулированию криптоактивов для противодействия их использованию в незаконных целях. Стратегия предполагает введение новых обязательств для поставщиков услуг с криптоактивами, усиление проверок транзакций с частными кошельками и более строгую проверку зарубежных криптокомпаний. Ирландия планирует внедрить эти отраслевые стандарты, соответствующие европейскому регламенту MiCA, во второй половине 2027 года. Стратегия также затрагивает вопросы использования криптоактивов в качестве источника средств для азартных игр.

cointelegraph6 ч. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

cointelegraph6 ч. назад

Торговля

Спот

Популярные статьи

Как купить T

Добро пожаловать на HTX.com! Мы сделали приобретение Threshold Network Token (T) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Threshold Network Token (T).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Threshold Network Token (T)После приобретения вами Threshold Network Token (T) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Threshold Network Token (T)С легкостью торгуйте Threshold Network Token (T) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.2k просмотров всегоОпубликовано 2024.03.29Обновлено 2026.06.02

Как купить T

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на T (T) представлены ниже.

活动图片