AI kiểm tra ngược 100 năm nghiên cứu: 99.2% tạp chí hàng đầu đều có vấn đề

marsbitDipublikasikan tanggal 2026-08-09Terakhir diperbarui pada 2026-08-09

Abstrak

AI đang thách thức độ tin cậy của các nghiên cứu khoa học. Một nghiên cứu gần đây sử dụng AI Agent để kiểm tra và tái hiện kết quả từ 92 bài báo tại hội nghị ICML 2026 cho thấy, chỉ có 8 bài có thể tái hiện hơn 80% kết luận. Lý do bao gồm mã nguồn thiếu file, kết quả không khớp, hoặc mô hình đã ngừng hoạt động. Đáng chú ý hơn, một hệ thống kiểm tra dựa trên GPT-5 phát hiện 99,2% bài báo trên các tạp chí/tuyển tập hàng đầu có ít nhất một lỗi khách quan, chủ yếu là lỗi toán học và công thức. Số lỗi trung bình mỗi bài có xu hướng tăng. Điều này mở ra hướng nghiên cứu mới: thay vì tìm chủ đề mới, các nhà nghiên cứu có thể sử dụng AI để kiểm tra, đặt câu hỏi và tìm lỗi trong các công trình cũ, thậm chí là từ hàng thập kỷ trước. AI cũng phát hiện lỗi trong cơ sở dữ liệu hóa học 75 năm tuổi, cho thấy tiềm năng "xem xét lại" lịch sử khoa học. Tuy nhiên, công cụ AI hiện tại vẫn có độ chính xác giới hạn (83,2%) và cần sự xác minh của con người. Việc công bố bài báo trong tương lai có thể chỉ là bước khởi đầu cho một quy trình xác minh bằng AI liên tục.

Còn ai dám nói nghiên cứu khoa học không còn vấn đề mới nữa? Hướng đi hay đều bị người trước chiếm hết rồi sao??

Nếu tôi nói rằng—

Phần lớn các bài báo đã đăng trên tạp chí hàng đầu, đều có vấn đề thì sao?

Gần đây, sau khi các nhà nghiên cứu dùng AI Agent "kiểm tra tính trung thực học thuật", họ phát hiện:

Trong số 92 bài báo được báo cáo tại Hội nghị Quốc tế về Máy học (ICML) 2026, có 58 bài đã không thể tái hiện lại được.

Thật hay giả vậy? Chẳng lẽ cơ hội đăng bài ồ ạt lên tạp chí hàng đầu thực sự đến rồi?

Bài báo hội nghị hàng đầu đang bị AI "vạch trần" tập thể

Thông thường, một bài báo được chấp nhận vào hội nghị hàng đầu có nghĩa là nó đã trải qua quá trình phản biện đồng nghiệp.

Tuy nhiên, do hạn chế về thời gian và công sức, các phản biện đồng nghiệp hầu như không có thời gian để tải dữ liệu từ đầu, chạy mô hình hoặc tái hiện thí nghiệm để kiểm chứng từng kết luận thực nghiệm trong bài báo.

Đồng thời, cùng với sự bùng nổ số lượng bài báo trong lĩnh vực AI, các mô hình ngày càng phức tạp, quy mô thí nghiệm ngày càng lớn, mã nguồn, dữ liệu, thiết lập tham số đằng sau một bài báo có thể liên quan đến hàng trăm chi tiết.

Khả năng kiểm chứng của bài báo cũng vì thế mà trở nên quan trọng hơn bao giờ hết. Bài báo được công bố rồi, nhưng các kết luận trong đó có thể chạy lại được không?

Hiện tại, AI Agent đã giảm đáng kể chi phí cho việc kiểm chứng và tái hiện này.

Ngày 22 tháng 7, một công ty nghiên cứu và kiểm duyệt của Mỹ đã sử dụng AI Agent để tiến hành kiểm toán hệ thống nhằm tái hiện kết quả cho toàn bộ 168 bài báo báo cáo trình bày miệng tại ICML 2026.

Trong 168 bài báo, có 92 bài có ít nhất 5 tuyên bố kết luận có thể kiểm chứng.

Kết quả cuối cùng là: Chỉ có 34 bài mà AI Agent có thể tái hiện thành công hơn bốn phần trăm kết luận; và chỉ có 8 bài có thể tái hiện hơn tám phần trăm kết luận.

Tuy nhiên, cần phải nói rõ rằng, giữa "không thể tái hiện" và "gian lận nghiên cứu" vẫn tồn tại một sự khác biệt rất lớn.

Lý do thất bại trong tái hiện bao gồm nhưng không giới hạn ở việc mã nguồn thiếu tệp quan trọng, phiên bản thư viện phụ thuộc bị đứt gãy, kết quả chạy không khớp với bài báo, và có 4 bài báo phụ thuộc vào mô hình đã ngừng hoạt động, điều này có nghĩa là kết quả thí nghiệm đã vĩnh viễn không thể được tái hiện bởi bất kỳ ai.

Ngoài ra, còn có một số trường hợp sai sót khá nghiêm trọng

Ví dụ, một bài báo lấy "chỉ huấn luyện 0.77% tham số của mô hình cơ sở" làm điểm bán hàng chính, nhưng checkpoint mã nguồn mở thực tế của nó lại huấn luyện tới 6.31% tham số, chênh lệch khoảng 8 lần.

Một bài báo khác đưa ra một bảng độ tin cậy dựa trên một mô hình đánh giá nhất định, nhưng mã nguồn mở của nó hoàn toàn không chứa mô hình đánh giá đó, cũng không có bất kỳ kịch bản nào có thể tạo ra kết quả trong bảng.

Cũng không phải trường hợp cá biệt, năm 2026, Hugging Face và AlphaXiv cùng phát động cuộc thi "Agent Reproduction Challenge" nhắm vào ICML 2026, mời các nhà nghiên cứu sử dụng AI Coding Agent để tự động hóa việc tái hiện các bài báo được chấp nhận tại ICML 2026, kết quả cũng rất không khả quan.

Xu hướng tương tự được thể hiện rõ hơn trong việc phát hiện thiếu sót, lỗi sai trong bài báo.

Cuối năm 2025, một nghiên cứu đã phát triển hệ thống kiểm tra bài báo dựa trên GPT-5, dùng để phân tích các bài báo đã đăng trên các hội nghị và tạp chí AI hàng đầu, tìm kiếm những vấn đề có thể kiểm chứng khách quan. Các nhà nghiên cứu đã nói rất rõ:

Chúng tôi chỉ tìm "lỗi khách quan", chúng tôi không quan tâm đến tính sáng tạo và giá trị nghiên cứu của bài báo.

Kết quả cuối cùng cho thấy, trung bình mỗi bài báo được phát hiện ra 4.7 lỗi khách quan, 99.2% bài báo ít nhất bị đánh dấu có một vấn đề.

Ảnh do AI tạo ra

Xét theo loại lỗi, lỗi toán học và công thức chiếm tỷ lệ cao nhất, đạt 54.0% (bao gồm viết sai phương trình, logic suy luận có lỗ hổng, giả định sai trong chứng minh, v.v.).

Khoảng 30.8% bài báo tại NeurIPS và 23.8% bài báo tại ICLR chứa ít nhất một lỗi thực chất có thể ảnh hưởng đến việc diễn giải kết quả.

Đáng chú ý hơn là xu hướng theo thời gian: Số lỗi trung bình mỗi bài báo tại NeurIPS đã tăng từ 3.8 lỗi năm 2021 lên 5.9 lỗi năm 2025, tăng 55.3%.

......

Có lẽ sau này, việc công bố bài báo không còn có nghĩa là nghiên cứu tuyên bố "chiến thắng", mà chỉ là bước vào vòng bắt đầu mới của quá trình kiểm chứng bằng AI.

Tin vui lớn cho tân binh học thuật: Không cần làm thí nghiệm vẫn có thể đăng tạp chí hàng đầu

Vì vậy, các bạn ơi, đối với những người đang loay hoay tìm đề tài, điều này thực sự có thể là một "tin tốt" khá bất ngờ.

Việc tra cứu tài liệu tìm lỗi, viết thư chỉnh sửa, vốn là hình thức sản phẩm học thuật chính thống trong giới học thuật, giờ đây xem ra, lại là một vùng biển xanh học thuật hoàn toàn mới.

Cụ thể bắt đầu từ đâu? Đây là vài gợi ý cho các tân binh học thuật đang lo về đề tài:

Thứ nhất, thay đổi tư duy nghiên cứu, không đua ở tuyến đầu mà đua với quá khứ.

Chuyển từ "tìm đề tài mới" sang "tìm điểm bất thường trong các bài báo cũ", tập trung vào những bài báo kinh điển được trích dẫn nhiều nhưng ít tranh cãi. Dù sao thì "99.2% bài báo ít nhất có một lỗi".

Thứ hai, để AI giúp bạn tạo bản đồ tri thức và hệ phả nghiên cứu.

Loại bản đồ tri thức này có thể giúp bạn hiểu—đâu là những công trình thực sự đặt nền móng? Quan điểm nghiên cứu nào hiện còn đang tranh cãi? Kết luận nào được trích dẫn nhiều nhưng thiếu kiểm chứng? Mối quan hệ trích dẫn giữa các bài báo khác nhau là gì? Từ đó, tìm ra những kết nối và điểm bất thường khó phát hiện trước đây.

Thứ ba, Hãy hỏi bất cứ điều gì (Ask anything).

Nhiều đột phá quan trọng trong lịch sử khoa học không đến từ việc đặt ra những câu hỏi hoàn toàn mới, mà đến từ việc xem xét lại một giả định đã được chấp nhận từ lâu.

Ví dụ: Một thí nghiệm kinh điển đã từng được kiểm chứng theo tiêu chuẩn ngày nay chưa? Một kết luận được trích dẫn rộng rãi, liệu có tồn tại điều kiện hạn chế chưa được chú ý?

Trước đây, việc đặt câu hỏi này có chi phí rất cao, các nhà nghiên cứu phải dành nhiều thời gian tra cứu tài liệu gốc, so sánh chi tiết thí nghiệm, nhưng giờ đây AI đã khiến chi phí đó gần như bằng không.

AI có thể bắt đầu tái cấu trúc lại lịch sử khoa học

Gần đây, nhà hóa học lý thuyết Pios từ Phòng thí nghiệm Chiết Giang, khi sử dụng AI để dự đoán điểm sôi của phân tử, đã phát hiện kết quả có mâu thuẫn rõ rệt với một cơ sở dữ liệu hóa học từ 75 năm trước.

Trước điều này, phản ứng đầu tiên của bất kỳ ai có lẽ đều là "chắc chắn là tôi sai rồi".

Pios cũng không ngoại lệ, anh vội vàng kiểm tra mô hình của mình. Nhưng sau khi truy ngược thủ công về tài liệu gốc, anh phát hiện: Trời ơi, hóa ra AI mới là bên đúng.

Pios vô cùng kinh ngạc, sau đó tiếp tục dùng AI để kiểm tra, thậm chí còn phát hiện ra một giá trị đo điểm sôi cách đây khoảng một thế kỷ và được giới học thuật công nhận là uy tín cũng bị sai.

Cần biết rằng, những dữ liệu này đã được trích dẫn và hấp thụ qua nhiều năm, nhiều thế hệ trong các nghiên cứu sau này.

Loại vấn đề này lâu nay không được phát hiện có thể liên quan trực tiếp đến quy mô của tài liệu khoa học.

Ảnh do AI tạo ra

Số lượng bài báo khoa học hiện đại đã vượt xa giới hạn đọc của bất kỳ nhà nghiên cứu cá nhân nào, ví dụ, chỉ riêng số lượng bài nộp hàng năm cho một hội nghị AI hàng đầu là ICLR đã tăng từ 1013 bài năm 2018 lên 19619 bài vào năm 2026.

Ở quy mô như vậy, một lỗi ban đầu xuất hiện trong một bài báo nào đó, một khi bị các tài liệu sau này trích dẫn lặp đi lặp lại, sẽ tiếp tục được truyền đi dọc theo chuỗi trích dẫn, hình thành nên sự đồng thuận học thuật trên thực tế.

Do thời gian đã lâu, chuỗi trích dẫn phức tạp, cộng với việc công tác kiểm tra lại tốn nhiều thời gian nhưng lợi ích học thuật hạn chế, phần lớn các lỗi đã đi vào hệ thống tài liệu chưa từng được xem xét một cách có hệ thống.

Nhưng giờ đây mọi thứ đã lung lay, ít nhất là về năng lực kỹ thuật, lần đầu tiên con người có khả năng xem xét lại quy mô lớn các tài liệu khoa học trong quá khứ.

Tuy nhiên, lấy ví dụ là Paper Correctness Checker chạy bằng GPT-5, độ chính xác phát hiện của nó là 83.2%, và trong mỗi lần kiểm tra vẫn còn khoảng bốn phần trăm lỗi thực sự chưa được phát hiện.

Có thể nói, bản thân các công cụ kiểm tra sự thật bằng AI như vậy không đủ tư cách để đóng vai trò quan tòa phán xét tài liệu khoa học, kết quả đầu ra của công cụ kiểm tra bằng AI cuối cùng vẫn cần được con người kiểm duyệt.

Bài viết từ tài khoản công khai WeChat "量子位" (ID: QbitAI), tác giả: Trình Thiển (程浅)

Kripto yang Sedang Tren

Pertanyaan Terkait

QTheo bài viết, kết quả của việc sử dụng AI Agent để kiểm tra các bài báo tại hội nghị ICML 2026 cho thấy điều gì?

AAI Agent đã kiểm tra 92 bài báo từ ICML 2026 có ít nhất 5 tuyên bố có thể kiểm chứng. Kết quả là chỉ có 34 bài có thể tái hiện được trên 40% kết luận, và chỉ 8 bài có thể tái hiện được trên 80% kết luận.

QNhững lý do nào được bài viết đề cập dẫn đến việc không thể tái hiện kết quả nghiên cứu?

ACác lý do bao gồm: mã nguồn thiếu tệp quan trọng, phiên bản thư viện phụ thuộc bị lỗi thời, kết quả chạy không khớp với bài báo, và một số mô hình phụ thuộc đã bị gỡ xuống.

QNghiên cứu dựa trên GPT-5 vào năm 2025 phát hiện tỷ lệ bài báo có vấn đề trong các hội nghị/tạp chí AI hàng đầu là bao nhiêu?

ANghiên cứu đó phát hiện 99.2% bài báo được kiểm tra có ít nhất một vấn đề khách quan có thể kiểm chứng.

QBài viết đưa ra những gợi ý nào cho các nhà nghiên cứu trẻ để tìm đề tài mới?

ABài viết gợi ý ba hướng: 1) Chuyển từ tìm đề tài mới sang tìm điểm bất thường trong các bài báo cũ, đặc biệt là các bài kinh điển được trích dẫn nhiều. 2) Sử dụng AI để tạo bản đồ tri thức và phả hệ nghiên cứu, phát hiện các kết nối và bất thường. 3) Đặt câu hỏi phản biện lại các giả định đã được chấp nhận từ lâu trong các nghiên cứu trước đây.

QVí dụ về nhà nghiên cứu Pios được nêu trong bài minh họa điều gì về tiềm năng của AI trong học thuật?

AVí dụ về nhà nghiên cứu Pios minh họa rằng AI có khả năng phát hiện và sửa chữa những sai sót tồn tại lâu đời trong cơ sở dữ liệu và tài liệu khoa học, thậm chí là những dữ liệu đã tồn tại hàng thế kỷ và được coi là chuẩn mực, từ đó mở ra khả năng xem xét lại lịch sử khoa học một cách có hệ thống.

Bacaan Terkait

Pengamatan Pasar Metrics Ventures: Saat "Perlombaan Mata Uang Buruk" Menjadi Norma, Bagaimana Memilih Aset Perlindungan Nilai?

**Pengamatan Pasar Metrics Ventures: Memilih Aset Safe Haven di Era "Persaingan Mata Uang yang Buruk"** Laporan bulanan Metrics Ventures untuk Juli-Agustus menyoroti tren makro ekonomi global di tengah ketidakpastian kebijakan moneter AS. Analisis menyimpulkan bahwa era "persaingan mata uang yang buruk" di antara negara-negara Barat telah menjadi norma, di mana kepercayaan terhadap mata uang fiat terus terkikis. Pasar bereaksi secara terpecah: pasar saham AS tampak percaya diri, sementara pasar obligasi dan valuta asing menunjukkan sinyal ketidakpercayaan. Logam mulia seperti emas telah menemukan dasar harga, mencerminkan konsensus bank sentral tentang tren penurunan mata uang yang tak terhindarkan. Menatap ke depan untuk kuartal III-IV, laporan ini merekomendasikan fokus pada aset-aset berikut: 1. **Sumber daya strategis** seperti tembaga dan listrik, yang terkait dengan ketegangan rantai pasokan global. 2. **Emas**, sebagai penyimpan nilai yang terus menilai ulang hilangnya kredibilitas mata uang. 3. **Aset-aset China (RMB)**, khususnya di sektor teknologi (contoh: indeks STAR 50), yang tren bullish-nya dinilai tetap kuat. 4. **Saham sumber daya komoditas** dalam pasar China, yang dianggap memiliki valuasi menarik dengan opsi imbal hasil dari kenaikan harga logam. Sementara itu, pasar cryptocurrency diperkirakan sulit mencatatkan kinerja unggul besar sebelum adanya pelonggaran likuiditas berlebih atau sebelum pertumbuhan AI sepenuhnya terharga di pasar. Inti laporan menekankan bahwa intervensi kebijakan (seperti intervensi nilai tukar AS-Jepang dan penggunaan fasilitas FIMA) menandakan pergeseran dalam pengelolaan moneter global. Dalam iklim ini, logam dan sumber daya nyata dipandang sebagai strategi berisiko rendah dengan nilai ekspektasi (EV) positif dalam jangka menengah.

marsbit1j yang lalu

Pengamatan Pasar Metrics Ventures: Saat "Perlombaan Mata Uang Buruk" Menjadi Norma, Bagaimana Memilih Aset Perlindungan Nilai?

marsbit1j yang lalu

Agustus, 'Bull Market' Wall Street Kembali, 'Sifat Judi' Juga Kembali

August menyaksikan kembalinya "bull market" di Wall Street, dengan S&P 500 mencapai rekor tertinggi baru. Sentimen investor berbalik positif dengan cepat setelah penjualan Juli, didorong oleh musim laba korporat yang luar biasa kuat (laba Q2 naik >50%) dan data inflasi AS yang lebih lembut, yang mengurangi tekanan kenaikan suku bunga Fed. Uang mengalir deras kembali ke saham teknologi dan produk leverage seperti ETF leverage dan opsi call, menandakan kembalinya "semangat berjudi". Saham chip seperti Super Micro Computer melonjak ~38% pada Agustus. Strategi leverage pada indeks luas berkinerja baik, berbeda dengan leverage pada saham tunggal. Namun, kenaikan cepat ini juga menimbulkan kewaspadaan. Pasar saat ini mematok skenario "masa keemasan" yang hampir sempurna: pertumbuhan kuat, suku bunga terbatas, dan guncangan sementara. Sinyal yang saling bertentangan muncul: harga minyak melonjak, imbal hasil obligasi pemerintah jangka panjang tetap tinggi (menandakan kekhawatiran inflasi jangka panjang), sementara indeks ketakutan VIX turun. Para analis memperingatkan bahwa kondisi ini sangat rapuh dan tidak memberikan ruang untuk kesalahan. Intinya: Pasar saham merayakan prospek soft landing dan siklus laba AI, tetapi pasar obligasi mengisyaratkan risiko yang belum terselesaikan. Pertarungan antara narasi optimis "Goldilocks" dan kekhawatiran inflasi jangka panjang akan menjadi tema utama di paruh kedua 2026.

marsbit2j yang lalu

Agustus, 'Bull Market' Wall Street Kembali, 'Sifat Judi' Juga Kembali

marsbit2j yang lalu

Trading

Spot

Artikel Populer

Cara Membeli T

Selamat datang di HTX.com! Kami telah membuat pembelian Threshold Network Token (T) menjadi mudah dan nyaman. Ikuti panduan langkah demi langkah kami untuk memulai perjalanan kripto Anda.Langkah 1: Buat Akun HTX AndaGunakan alamat email atau nomor ponsel Anda untuk mendaftar akun gratis di HTX. Rasakan perjalanan pendaftaran yang mudah dan buka semua fitur.Dapatkan Akun SayaLangkah 2: Buka Beli Kripto, lalu Pilih Metode Pembayaran AndaKartu Kredit/Debit: Gunakan Visa atau Mastercard Anda untuk membeli Threshold Network Token (T) secara instan.Saldo: Gunakan dana dari saldo akun HTX Anda untuk melakukan trading dengan lancar.Pihak Ketiga: Kami telah menambahkan metode pembayaran populer seperti Google Pay dan Apple Pay untuk meningkatkan kenyamanan.P2P: Lakukan trading langsung dengan pengguna lain di HTX.Over-the-Counter (OTC): Kami menawarkan layanan yang dibuat khusus dan kurs yang kompetitif bagi para trader.Langkah 3: Simpan Threshold Network Token (T) AndaSetelah melakukan pembelian, simpan Threshold Network Token (T) di akun HTX Anda. Selain itu, Anda dapat mengirimkannya ke tempat lain melalui transfer blockchain atau menggunakannya untuk memperdagangkan mata uang kripto lainnya.Langkah 4: Lakukan trading Threshold Network Token (T)Lakukan trading Threshold Network Token (T) dengan mudah di pasar spot HTX. Cukup akses akun Anda, pilih pasangan perdagangan, jalankan trading, lalu pantau secara real-time. Kami menawarkan pengalaman yang ramah pengguna baik untuk pemula maupun trader berpengalaman.

1.2k Total TayanganDipublikasikan pada 2024.12.10Diperbarui pada 2026.06.02

Cara Membeli T

Diskusi

Selamat datang di Komunitas HTX. Di sini, Anda bisa terus mendapatkan informasi terbaru tentang perkembangan platform terkini dan mendapatkan akses ke wawasan pasar profesional. Pendapat pengguna mengenai harga T (T) disajikan di bawah ini.

活动图片