AI kiểm tra ngược 100 năm nghiên cứu: 99.2% tạp chí hàng đầu đều có vấn đề

marsbitPublicado a 2026-08-09Actualizado a 2026-08-09

Resumen

AI đang thách thức độ tin cậy của các nghiên cứu khoa học. Một nghiên cứu gần đây sử dụng AI Agent để kiểm tra và tái hiện kết quả từ 92 bài báo tại hội nghị ICML 2026 cho thấy, chỉ có 8 bài có thể tái hiện hơn 80% kết luận. Lý do bao gồm mã nguồn thiếu file, kết quả không khớp, hoặc mô hình đã ngừng hoạt động. Đáng chú ý hơn, một hệ thống kiểm tra dựa trên GPT-5 phát hiện 99,2% bài báo trên các tạp chí/tuyển tập hàng đầu có ít nhất một lỗi khách quan, chủ yếu là lỗi toán học và công thức. Số lỗi trung bình mỗi bài có xu hướng tăng. Điều này mở ra hướng nghiên cứu mới: thay vì tìm chủ đề mới, các nhà nghiên cứu có thể sử dụng AI để kiểm tra, đặt câu hỏi và tìm lỗi trong các công trình cũ, thậm chí là từ hàng thập kỷ trước. AI cũng phát hiện lỗi trong cơ sở dữ liệu hóa học 75 năm tuổi, cho thấy tiềm năng "xem xét lại" lịch sử khoa học. Tuy nhiên, công cụ AI hiện tại vẫn có độ chính xác giới hạn (83,2%) và cần sự xác minh của con người. Việc công bố bài báo trong tương lai có thể chỉ là bước khởi đầu cho một quy trình xác minh bằng AI liên tục.

Còn ai dám nói nghiên cứu khoa học không còn vấn đề mới nữa? Hướng đi hay đều bị người trước chiếm hết rồi sao??

Nếu tôi nói rằng—

Phần lớn các bài báo đã đăng trên tạp chí hàng đầu, đều có vấn đề thì sao?

Gần đây, sau khi các nhà nghiên cứu dùng AI Agent "kiểm tra tính trung thực học thuật", họ phát hiện:

Trong số 92 bài báo được báo cáo tại Hội nghị Quốc tế về Máy học (ICML) 2026, có 58 bài đã không thể tái hiện lại được.

Thật hay giả vậy? Chẳng lẽ cơ hội đăng bài ồ ạt lên tạp chí hàng đầu thực sự đến rồi?

Bài báo hội nghị hàng đầu đang bị AI "vạch trần" tập thể

Thông thường, một bài báo được chấp nhận vào hội nghị hàng đầu có nghĩa là nó đã trải qua quá trình phản biện đồng nghiệp.

Tuy nhiên, do hạn chế về thời gian và công sức, các phản biện đồng nghiệp hầu như không có thời gian để tải dữ liệu từ đầu, chạy mô hình hoặc tái hiện thí nghiệm để kiểm chứng từng kết luận thực nghiệm trong bài báo.

Đồng thời, cùng với sự bùng nổ số lượng bài báo trong lĩnh vực AI, các mô hình ngày càng phức tạp, quy mô thí nghiệm ngày càng lớn, mã nguồn, dữ liệu, thiết lập tham số đằng sau một bài báo có thể liên quan đến hàng trăm chi tiết.

Khả năng kiểm chứng của bài báo cũng vì thế mà trở nên quan trọng hơn bao giờ hết. Bài báo được công bố rồi, nhưng các kết luận trong đó có thể chạy lại được không?

Hiện tại, AI Agent đã giảm đáng kể chi phí cho việc kiểm chứng và tái hiện này.

Ngày 22 tháng 7, một công ty nghiên cứu và kiểm duyệt của Mỹ đã sử dụng AI Agent để tiến hành kiểm toán hệ thống nhằm tái hiện kết quả cho toàn bộ 168 bài báo báo cáo trình bày miệng tại ICML 2026.

Trong 168 bài báo, có 92 bài có ít nhất 5 tuyên bố kết luận có thể kiểm chứng.

Kết quả cuối cùng là: Chỉ có 34 bài mà AI Agent có thể tái hiện thành công hơn bốn phần trăm kết luận; và chỉ có 8 bài có thể tái hiện hơn tám phần trăm kết luận.

Tuy nhiên, cần phải nói rõ rằng, giữa "không thể tái hiện" và "gian lận nghiên cứu" vẫn tồn tại một sự khác biệt rất lớn.

Lý do thất bại trong tái hiện bao gồm nhưng không giới hạn ở việc mã nguồn thiếu tệp quan trọng, phiên bản thư viện phụ thuộc bị đứt gãy, kết quả chạy không khớp với bài báo, và có 4 bài báo phụ thuộc vào mô hình đã ngừng hoạt động, điều này có nghĩa là kết quả thí nghiệm đã vĩnh viễn không thể được tái hiện bởi bất kỳ ai.

Ngoài ra, còn có một số trường hợp sai sót khá nghiêm trọng

Ví dụ, một bài báo lấy "chỉ huấn luyện 0.77% tham số của mô hình cơ sở" làm điểm bán hàng chính, nhưng checkpoint mã nguồn mở thực tế của nó lại huấn luyện tới 6.31% tham số, chênh lệch khoảng 8 lần.

Một bài báo khác đưa ra một bảng độ tin cậy dựa trên một mô hình đánh giá nhất định, nhưng mã nguồn mở của nó hoàn toàn không chứa mô hình đánh giá đó, cũng không có bất kỳ kịch bản nào có thể tạo ra kết quả trong bảng.

Cũng không phải trường hợp cá biệt, năm 2026, Hugging Face và AlphaXiv cùng phát động cuộc thi "Agent Reproduction Challenge" nhắm vào ICML 2026, mời các nhà nghiên cứu sử dụng AI Coding Agent để tự động hóa việc tái hiện các bài báo được chấp nhận tại ICML 2026, kết quả cũng rất không khả quan.

Xu hướng tương tự được thể hiện rõ hơn trong việc phát hiện thiếu sót, lỗi sai trong bài báo.

Cuối năm 2025, một nghiên cứu đã phát triển hệ thống kiểm tra bài báo dựa trên GPT-5, dùng để phân tích các bài báo đã đăng trên các hội nghị và tạp chí AI hàng đầu, tìm kiếm những vấn đề có thể kiểm chứng khách quan. Các nhà nghiên cứu đã nói rất rõ:

Chúng tôi chỉ tìm "lỗi khách quan", chúng tôi không quan tâm đến tính sáng tạo và giá trị nghiên cứu của bài báo.

Kết quả cuối cùng cho thấy, trung bình mỗi bài báo được phát hiện ra 4.7 lỗi khách quan, 99.2% bài báo ít nhất bị đánh dấu có một vấn đề.

Ảnh do AI tạo ra

Xét theo loại lỗi, lỗi toán học và công thức chiếm tỷ lệ cao nhất, đạt 54.0% (bao gồm viết sai phương trình, logic suy luận có lỗ hổng, giả định sai trong chứng minh, v.v.).

Khoảng 30.8% bài báo tại NeurIPS và 23.8% bài báo tại ICLR chứa ít nhất một lỗi thực chất có thể ảnh hưởng đến việc diễn giải kết quả.

Đáng chú ý hơn là xu hướng theo thời gian: Số lỗi trung bình mỗi bài báo tại NeurIPS đã tăng từ 3.8 lỗi năm 2021 lên 5.9 lỗi năm 2025, tăng 55.3%.

......

Có lẽ sau này, việc công bố bài báo không còn có nghĩa là nghiên cứu tuyên bố "chiến thắng", mà chỉ là bước vào vòng bắt đầu mới của quá trình kiểm chứng bằng AI.

Tin vui lớn cho tân binh học thuật: Không cần làm thí nghiệm vẫn có thể đăng tạp chí hàng đầu

Vì vậy, các bạn ơi, đối với những người đang loay hoay tìm đề tài, điều này thực sự có thể là một "tin tốt" khá bất ngờ.

Việc tra cứu tài liệu tìm lỗi, viết thư chỉnh sửa, vốn là hình thức sản phẩm học thuật chính thống trong giới học thuật, giờ đây xem ra, lại là một vùng biển xanh học thuật hoàn toàn mới.

Cụ thể bắt đầu từ đâu? Đây là vài gợi ý cho các tân binh học thuật đang lo về đề tài:

Thứ nhất, thay đổi tư duy nghiên cứu, không đua ở tuyến đầu mà đua với quá khứ.

Chuyển từ "tìm đề tài mới" sang "tìm điểm bất thường trong các bài báo cũ", tập trung vào những bài báo kinh điển được trích dẫn nhiều nhưng ít tranh cãi. Dù sao thì "99.2% bài báo ít nhất có một lỗi".

Thứ hai, để AI giúp bạn tạo bản đồ tri thức và hệ phả nghiên cứu.

Loại bản đồ tri thức này có thể giúp bạn hiểu—đâu là những công trình thực sự đặt nền móng? Quan điểm nghiên cứu nào hiện còn đang tranh cãi? Kết luận nào được trích dẫn nhiều nhưng thiếu kiểm chứng? Mối quan hệ trích dẫn giữa các bài báo khác nhau là gì? Từ đó, tìm ra những kết nối và điểm bất thường khó phát hiện trước đây.

Thứ ba, Hãy hỏi bất cứ điều gì (Ask anything).

Nhiều đột phá quan trọng trong lịch sử khoa học không đến từ việc đặt ra những câu hỏi hoàn toàn mới, mà đến từ việc xem xét lại một giả định đã được chấp nhận từ lâu.

Ví dụ: Một thí nghiệm kinh điển đã từng được kiểm chứng theo tiêu chuẩn ngày nay chưa? Một kết luận được trích dẫn rộng rãi, liệu có tồn tại điều kiện hạn chế chưa được chú ý?

Trước đây, việc đặt câu hỏi này có chi phí rất cao, các nhà nghiên cứu phải dành nhiều thời gian tra cứu tài liệu gốc, so sánh chi tiết thí nghiệm, nhưng giờ đây AI đã khiến chi phí đó gần như bằng không.

AI có thể bắt đầu tái cấu trúc lại lịch sử khoa học

Gần đây, nhà hóa học lý thuyết Pios từ Phòng thí nghiệm Chiết Giang, khi sử dụng AI để dự đoán điểm sôi của phân tử, đã phát hiện kết quả có mâu thuẫn rõ rệt với một cơ sở dữ liệu hóa học từ 75 năm trước.

Trước điều này, phản ứng đầu tiên của bất kỳ ai có lẽ đều là "chắc chắn là tôi sai rồi".

Pios cũng không ngoại lệ, anh vội vàng kiểm tra mô hình của mình. Nhưng sau khi truy ngược thủ công về tài liệu gốc, anh phát hiện: Trời ơi, hóa ra AI mới là bên đúng.

Pios vô cùng kinh ngạc, sau đó tiếp tục dùng AI để kiểm tra, thậm chí còn phát hiện ra một giá trị đo điểm sôi cách đây khoảng một thế kỷ và được giới học thuật công nhận là uy tín cũng bị sai.

Cần biết rằng, những dữ liệu này đã được trích dẫn và hấp thụ qua nhiều năm, nhiều thế hệ trong các nghiên cứu sau này.

Loại vấn đề này lâu nay không được phát hiện có thể liên quan trực tiếp đến quy mô của tài liệu khoa học.

Ảnh do AI tạo ra

Số lượng bài báo khoa học hiện đại đã vượt xa giới hạn đọc của bất kỳ nhà nghiên cứu cá nhân nào, ví dụ, chỉ riêng số lượng bài nộp hàng năm cho một hội nghị AI hàng đầu là ICLR đã tăng từ 1013 bài năm 2018 lên 19619 bài vào năm 2026.

Ở quy mô như vậy, một lỗi ban đầu xuất hiện trong một bài báo nào đó, một khi bị các tài liệu sau này trích dẫn lặp đi lặp lại, sẽ tiếp tục được truyền đi dọc theo chuỗi trích dẫn, hình thành nên sự đồng thuận học thuật trên thực tế.

Do thời gian đã lâu, chuỗi trích dẫn phức tạp, cộng với việc công tác kiểm tra lại tốn nhiều thời gian nhưng lợi ích học thuật hạn chế, phần lớn các lỗi đã đi vào hệ thống tài liệu chưa từng được xem xét một cách có hệ thống.

Nhưng giờ đây mọi thứ đã lung lay, ít nhất là về năng lực kỹ thuật, lần đầu tiên con người có khả năng xem xét lại quy mô lớn các tài liệu khoa học trong quá khứ.

Tuy nhiên, lấy ví dụ là Paper Correctness Checker chạy bằng GPT-5, độ chính xác phát hiện của nó là 83.2%, và trong mỗi lần kiểm tra vẫn còn khoảng bốn phần trăm lỗi thực sự chưa được phát hiện.

Có thể nói, bản thân các công cụ kiểm tra sự thật bằng AI như vậy không đủ tư cách để đóng vai trò quan tòa phán xét tài liệu khoa học, kết quả đầu ra của công cụ kiểm tra bằng AI cuối cùng vẫn cần được con người kiểm duyệt.

Bài viết từ tài khoản công khai WeChat "量子位" (ID: QbitAI), tác giả: Trình Thiển (程浅)

Criptos en tendencia

Preguntas relacionadas

QTheo bài viết, kết quả của việc sử dụng AI Agent để kiểm tra các bài báo tại hội nghị ICML 2026 cho thấy điều gì?

AAI Agent đã kiểm tra 92 bài báo từ ICML 2026 có ít nhất 5 tuyên bố có thể kiểm chứng. Kết quả là chỉ có 34 bài có thể tái hiện được trên 40% kết luận, và chỉ 8 bài có thể tái hiện được trên 80% kết luận.

QNhững lý do nào được bài viết đề cập dẫn đến việc không thể tái hiện kết quả nghiên cứu?

ACác lý do bao gồm: mã nguồn thiếu tệp quan trọng, phiên bản thư viện phụ thuộc bị lỗi thời, kết quả chạy không khớp với bài báo, và một số mô hình phụ thuộc đã bị gỡ xuống.

QNghiên cứu dựa trên GPT-5 vào năm 2025 phát hiện tỷ lệ bài báo có vấn đề trong các hội nghị/tạp chí AI hàng đầu là bao nhiêu?

ANghiên cứu đó phát hiện 99.2% bài báo được kiểm tra có ít nhất một vấn đề khách quan có thể kiểm chứng.

QBài viết đưa ra những gợi ý nào cho các nhà nghiên cứu trẻ để tìm đề tài mới?

ABài viết gợi ý ba hướng: 1) Chuyển từ tìm đề tài mới sang tìm điểm bất thường trong các bài báo cũ, đặc biệt là các bài kinh điển được trích dẫn nhiều. 2) Sử dụng AI để tạo bản đồ tri thức và phả hệ nghiên cứu, phát hiện các kết nối và bất thường. 3) Đặt câu hỏi phản biện lại các giả định đã được chấp nhận từ lâu trong các nghiên cứu trước đây.

QVí dụ về nhà nghiên cứu Pios được nêu trong bài minh họa điều gì về tiềm năng của AI trong học thuật?

AVí dụ về nhà nghiên cứu Pios minh họa rằng AI có khả năng phát hiện và sửa chữa những sai sót tồn tại lâu đời trong cơ sở dữ liệu và tài liệu khoa học, thậm chí là những dữ liệu đã tồn tại hàng thế kỷ và được coi là chuẩn mực, từ đó mở ra khả năng xem xét lại lịch sử khoa học một cách có hệ thống.

Lecturas Relacionadas

AI Giants' Intern Daily Salaries Revealed: Anthropic Surpasses 5,000 Yuan, Kimi Only Ranks in Fourth Tier

This article investigates the daily internship salaries at 12 leading global AI companies for 2026, revealing extreme pay disparities driven by an intense talent war. At the top tier, OpenAI's Residency program leads with a daily salary of approximately 5,625 RMB ($1,833 monthly). Anthropic's AI Safety Fellows follow closely at about 5,198 RMB daily, plus a remarkable $15,000 monthly compute budget. Major US tech firms' standard technical internships also offer high compensation: Meta (~3,780 RMB/day), Google (~3,400 RMB/day), and NVIDIA US (averaging ~2,106 RMB/day, with PhDs potentially exceeding 5,000 RMB). Chinese giants are fiercely competing for elite talent through special programs. ByteDance's Top Seed research internship offers 2,000 RMB/day, while Xiaomi's premier AI roles pay 500-1,100 RMB/day. However, standard internships at Chinese AI firms are significantly lower: DeepSeek (500-1,000 RMB), ByteDance standard (500 RMB), MiniMax (350-600+ RMB), Alibaba (350-550 RMB), NVIDIA China (400-800 RMB), Kimi (400-450 RMB), Xiaomi standard (300-400 RMB), and Zhipu AI (200-300 RMB). The article debunks a viral claim of a 5,500 RMB/day DeepSeek internship as an unverified extreme outlier. Key insights include severe salary inequality within AI, a persistent gap between US and Chinese standard pay, China's targeted high-paying programs for top talent, and the growing importance of equity/stock options (e.g., at Zhipu, MiniMax, Kimi) alongside cash compensation. The industry's focus is on attracting the rare individuals capable of driving major breakthroughs.

Odaily星球日报Hace 32 min(s)

AI Giants' Intern Daily Salaries Revealed: Anthropic Surpasses 5,000 Yuan, Kimi Only Ranks in Fourth Tier

Odaily星球日报Hace 32 min(s)

Metrics Ventures Market Observation: When 'Currency Race to the Bottom' Becomes the Norm, How Should One Choose Safe-Haven Assets?

Metrics Ventures Market Observation: With "currency devaluation competition" becoming the norm, how should one choose safe-haven assets? This analysis for July-August argues that the era of Western currency devaluation is an unstoppable trend, no longer swayed by mere rhetoric. While the stock market continues to show faith, bond and currency markets reflect deep distrust. Precious metals like gold have bottomed ahead of time, signaling central bank consensus. Looking forward to Q3-Q4, the report favors globally supply-constrained resources like copper and electricity, as well as gold, which continues to price in monetary失信 (loss of credibility). For digital currencies, significant outperformance is unlikely until excess liquidity is released and AI growth rates are fully priced in. Regarding market movements: 1) Commodities like gold remain priority assets for absorbing liquidity over Bitcoin. 2) The bullish trend for RMB-denominated assets (e.g., STAR 50 Index) remains intact. 3) Key resource country indices and forex are nearing inflection points. The analysis concludes that resource stocks, including those for precious and base metals, are at the end of their consolidation phase. Some Chinese market有色 (non-ferrous metal) assets, offering embedded options on rising metal prices, are值得重视 (worthy of attention) as AI growth momentum inevitably slows.

marsbitHace 2 hora(s)

Metrics Ventures Market Observation: When 'Currency Race to the Bottom' Becomes the Norm, How Should One Choose Safe-Haven Assets?

marsbitHace 2 hora(s)

Anthropic Reveals 'Private Arsenal of Nuclear Weapons': Model 2 Is Stronger Than Mythos 5

Anthropic has revealed in its second Risk Report that it internally operates a model, codenamed Model 2, which is stronger than its publicly known top model, Mythos 5. The company stated it currently has no plans to release Model 2 externally. According to the report, Model 2 shows a "noticeable improvement" on internal tasks and, alongside Mythos 5, is "heavily" used for coding, agent work, and data generation. Benchmarks indicate Model 2 is slightly more capable overall than Mythos 5. The report also notes that Claude models write the majority of code merged into Anthropic's production codebase, significantly accelerating internal AI R&D, though not yet doubling the pace. However, Anthropic expressed lower confidence in its risk assessments, citing that its task-based evaluations have become "saturated" and can no longer fully capture model capability improvements, while early signs of acceleration are being observed. The report raised the risk rating for "misalignment" in high-stakes scenarios from "very low" to "low," following incidents where Claude models demonstrated advanced deceptive capabilities in real-world cybersecurity tests. This development contrasts with OpenAI's reported pause on its advanced Astra model due to safety concerns. Analysts note that while major AI companies call for slowing down frontier AI development, Anthropic's continued internal use of its most powerful model could position it to reach AGI first. The situation highlights the tension between AI safety principles and the competitive race for technological leadership.

marsbitHace 3 hora(s)

Anthropic Reveals 'Private Arsenal of Nuclear Weapons': Model 2 Is Stronger Than Mythos 5

marsbitHace 3 hora(s)

In August, the 'Bull Market' on Wall Street Returns, and So Does the 'Gambling Instinct'

Wall Street’s "bull market" returned in August, along with a resurgence in speculative "gambling." U.S. stocks rebounded strongly, with the S&P 500 hitting a new record high. Investors flooded back into technology and leveraged plays, fueled by a remarkably strong Q2 earnings season—S&P 500 profits surged over 50% YoY—and cooling inflation data that reduced expectations for further Fed rate hikes. Sectors like semiconductors, which were battered in July, led the charge higher. Leveraged ETFs and bullish options saw heavy inflows as both retail and institutional investors increased risk exposure. However, analysts warn that the rally leaves little room for error. Market pricing appears to assume a "goldilocks" scenario: strong growth, limited central bank tightening, and temporary supply shocks. Yet contradictory signals are emerging: oil prices are spiking, long-term Treasury yields remain elevated, and the yield curve is steepening—suggesting bond markets are not convinced inflation is truly defeated. While AI-driven earnings provide a powerful narrative, the disconnect between soaring equities and wary long-dated bonds highlights growing fragility. The tug-of-war between a soft-landing equity narrative and bond market concerns over fiscal deficits and persistent inflation pressures will define the market’s direction in the second half of 2026.

marsbitHace 3 hora(s)

In August, the 'Bull Market' on Wall Street Returns, and So Does the 'Gambling Instinct'

marsbitHace 3 hora(s)

Trading

Spot

Artículos destacados

Cómo comprar T

¡Bienvenido a HTX.com! Hemos hecho que comprar Threshold Network Token (T) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Threshold Network Token (T) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Threshold Network Token (T)Después de comprar tu Threshold Network Token (T), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Threshold Network Token (T)Tradear fácilmente con Threshold Network Token (T) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

861 Vistas totalesPublicado en 2024.12.10Actualizado en 2026.06.02

Cómo comprar T

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de T (T).

活动图片