AI倒查论文100年,99.2%的顶刊都有问题

marsbit发布于2026-08-09更新于2026-08-09

文章摘要

研究发现,AI正成为学术论文的“打假利器”。一项针对2026年ICML会议口头报告论文的复现审计显示,在92篇具备可验证结论的论文中,仅34篇能被AI成功复现超过四成结论,仅8篇能复现八成以上。复现失败原因包括代码缺失、依赖断裂、结果不符,甚至存在参数描述夸大八倍、关键模型缺失等明显问题。 另一项基于GPT-5的论文检查系统分析显示,平均每篇顶刊论文被检测出4.7个客观错误,99.2%的论文至少存在一个问题。错误类型中,数学与公式错误占比最高(54.0%),且篇均错误数呈现上升趋势。 这对研究者而言可能成为新机遇:研究方向可从“追求前沿”转向“核查经典”,利用AI构建知识图谱、发现历史文献中的异常与未被验证的假设。例如,已有研究者通过AI发现并纠正了75年前甚至一个世纪前的权威化学数据错误。 然而,AI核查工具目前精确率有限(如83.2%),仍有近四成错误未被检出,其结论最终需人工审核。未来,论文发表或许不再是研究的终点,而是进入新一轮AI验证的开始。

谁再说科研已经没有新问题了?好方向全被前人占满了??

如果我说——

那些已经发表的顶刊论文里,大多都有问题呢?

最近,有研究者用AI Agent「学术打假」后发现:

2026年国际机器学习大会(ICML)上报告的92篇论文中,有58篇已经无法复现。

真假??莫非,猛发顶刊的机会真的来了?

顶会论文正在集体被AI「打假」

通常一篇论文能够进入顶级会议,就说明它已经经过了同行评审。

然而受精力所限,同行评审审稿人几乎没有时间从头下载数据、运行模型或复现实验,以验证论文中的每一个实验结论。

与此同时随着AI领域的论文数量爆炸增长,模型越来越复杂,实验规模越来越大,一篇论文背后的代码、数据、参数设置可能涉及数百个细节

论文的可验证性也就变得越发重要,论文发表了,但其中的结论能被重新跑出来吗?

目前,AI Agent大大降低了这种验证和复现的成本

7月22日,美国某研究审查公司用AI Agent对ICML 2026全部168篇口头报告论文进行了系统性的结果复现审计。

168篇论文中有92篇拥有至少5条可供验证的结论性声明。

最终的结果是:AI Agent能够成功复现超过四成结论的,只有34篇;而能复现八成以上结论的,仅有8篇

不过需要说明的是,“无法复现”和“研究造假”之间还存在着巨大区别。

复现失败的原因包括不限于代码缺少关键文件、依赖库版本断裂、运行结果与论文不符,还有4篇论文依赖的模型已下线,这意味着实验结果已经永久性地无法被任何人复现。

除此外,还有一些就错的比较离谱了——

比如,一篇论文将「仅训练基础模型0.77%的参数」作为核心卖点,但其实际开源的checkpoint训练了6.31%的参数,相差约8倍

另一篇论文放了一张基于某评判模型的可靠性表格,但其开源代码中根本不包含该评判模型,也没有任何脚本能够生成表格里的结果。

无独有偶,2026年抱抱脸与AlphaXiv联合发起针对ICML 2026的「Agent Reproduction Challenge」挑战赛,邀请研究者使用AI Coding Agent对ICML 2026接收的论文进行自动化复现,结果同样很不乐观。

类似的趋势在论文错漏检测中的体现更令人惊异。

2025年底,一项研究开发了基于GPT-5的论文检查系统,用于分析已经发表在顶级 AI 会议和期刊上的论文,寻找可以客观验证的问题。研究者非常明确地表示:

我们只看「客观错误」,我们不管论文的创新性和研究价值。

最终结果显示,平均每篇论文被检测出4.7个客观错误,99.2%的论文至少被标记出了一个问题

图片系AI生成

从错误类型来看,数学与公式错误占比最高,达到54.0%(包括方程式写错、推导逻辑有漏洞、证明中的错误假设等)。

大约30.8%的NeurIPS论文和23.8%的ICLR论文包含至少一个可能影响结果解读的实质性错误

更值得注意的是时间趋势:NeurIPS论文的篇均错误数从2021年的3.8个上升至2025年的5.9个,涨幅55.3%。

......

或许在今后,论文发表不再意味着研究宣告「胜利」,而只是再次进入了下一轮AI验证的开始。

学术萌新重大利好,不做实验也能发顶刊

所以,朋友们,这对正在愁选题的人来说,可能还真是个相当意外的「利好」。

查文献挑错、写勘误,本来就是学术圈里正经八百的产出形式,如今看来,完全的学术蓝海啊。

具体怎么下手?给愁选题的学术萌新们支几招:

第一,转变研究思路,不卷前沿卷过去。

从“找新选题”转向“找旧论文里的异常点”,重点关注那些被大量引用但争议较少的经典论文。毕竟“99.2%的论文至少有一处错误”。

第二,让AI帮你制作知识地图和研究谱系。

这种知识地图可以帮你理解——哪些是真正的奠基性工作?哪些研究观点目前还存在争议?哪些结论被大量引用但缺少验证?不同论文之间的引用关系是什么?从而由此找到过去难以发现的连接和异常

第三,Ask anything.

科学史上的很多重要突破并不来自于提出全新的问题,而来自重新审视一个长期被接受的假设

例如:一个经典实验是否按照今天的标准被验证过?一个被广泛引用的结论,是否存在未被注意的限制条件?

过去,这种追问成本非常高,研究者需要花费大量时间查阅原始文献、比较实验细节,而如今AI让这种成本几乎归零了。

AI或将开始重整科学史

最近,浙江实验室理论化学家Pios在使用AI预测分子沸点时,发现结果与一份75年前的化学数据库存在明显冲突。

对此,任何人的第一反应可能都是“那肯定是我错了呗”。

Pios也不例外,他连忙检查自己的模型。但在手动回溯了原始文献之后他发现:天呐,AI竟然是对的那一个

Pios大为惊讶,随后用AI继续核查,竟然还发现了一份约一个世纪前且被学界公认权威的沸点测量值也是错的

要知道,这些数据已经被经年累月地引用、吸纳于后代的研究之中。

这类问题此前长期未被发现可能与科学文献的规模直接相关

图片系AI生成

现代科学论文的数量已经远远超出任何个体研究者的阅读极限,例如,仅一家人工智能顶会ICLR的年度投稿量就从2018年的1013篇上升至2026年的19619篇。

在这样的规模下,一处最初出现在某篇论文中的错误一旦被后续文献反复引用,就会沿着引用链持续传递,形成事实上的学术共识。

由于年代久远、引用链条复杂,加之复核工作耗时巨大而学术回报有限,绝大多数已进入文献体系的错误从未被系统性地审视过。

但如今一切都松动了,至少在技术能力上,人们首次具备了大规模重审过往科学文献的可能。

不过,以GPT-5驱动的Paper Correctness Checker为例,其检测精确率为83.2%,且每次检测中仍有约四成真实错误未被检出。

可以说,此类AI事实核查工具本身不足以担任科学文献的判官,AI核查工具的输出结果最后还需要人工来审核。

本文来自微信公众号 “量子位”(ID:QbitAI),作者:程浅

热门币种推荐

相关问答

Q文章中提到AI Agent对哪一年的ICML会议论文进行了复现审计,结果如何?

A文章提到,2026年国际机器学习大会(ICML)上报告的92篇论文中,有58篇已经无法复现。最终,AI Agent能够成功复现超过四成结论的只有34篇,而能复现八成以上结论的仅有8篇。

Q根据文章,AI检测论文错误时,哪种错误类型占比最高?

A根据文章,AI检测论文错误时,数学与公式错误占比最高,达到54.0%。这类错误包括方程式写错、推导逻辑有漏洞、证明中的错误假设等。

Q文章对‘无法复现’和‘研究造假’之间关系是如何说明的?

A文章明确指出,“无法复现”和“研究造假”之间存在着巨大区别。复现失败的原因包括但不限于代码缺少关键文件、依赖库版本断裂、运行结果与论文不符,以及有些论文依赖的模型已下线。

Q文章为‘学术萌新’提出了哪三个具体的研究思路建议?

A文章为‘学术萌新’提出了三个具体建议:第一,转变研究思路,从‘找新选题’转向‘找旧论文里的异常点’;第二,让AI帮忙制作知识地图和研究谱系,以发现过去难以发现的连接和异常;第三,勇于‘Ask anything’,重新审视长期被接受的假设。

Q文章末尾提到AI核查工具(如GPT-5驱动的Paper Correctness Checker)的精确率和局限性是什么?

A文章提到,以GPT-5驱动的Paper Correctness Checker为例,其检测精确率为83.2%,但每次检测中仍有约四成真实错误未被检出。文章指出,此类AI事实核查工具本身不足以担任科学文献的判官,其输出结果最后还需要人工来审核。

你可能也喜欢

假冒Ledger的内部构造:如何将4G调制解调器秘密植入硬件钱包

在2026年Hardwear.io安全会议上,硬件安全专家Joe Grand详细剖析了一款植入伪造版Ledger Nano X硬件钱包中的间谍芯片。该设备最早于2021年被Reddit用户发现,受害者通过2020年Ledger数据泄露后的钓鱼邮件获得了这些被动过手脚的钱包。 间谍芯片通过连接到设备内部SPI总线来工作,该总线用于安全元件与OLED屏幕之间的通信。芯片截取数据传输,利用模式识别技术“读取”用户在生成或恢复钱包时在屏幕上看到的助记词。窃取的助记词被存储后,并非通过Wi-Fi或蓝牙,而是通过内置的4G调制解调器和eSIM,经由蜂窝网络发送出去。为容纳额外电子元件,攻击者减小了电池尺寸,并用固定电阻替换了热敏电阻,使电量始终显示100%以掩人耳目。 这不是供应链攻击首次针对硬件钱包。类似手法此前也在Trezor设备上出现,攻击者替换微控制器并安装恶意固件,生成预先可知的助记词。这些伪造设备主要通过俄罗斯电商平台销售。 Ledger公司建议用户对比设备外观,并仅从官方或授权经销商处购买。公司也表示正在考虑为未来产品增加物理防护措施。 报告指出,风险核心在于物理供应链本身。即便应用程序运行正常、屏幕显示无误,也无法保证设备内部未被植入恶意硬件。此事件凸显了保护助记词需要整个供应链环节——从芯片制造、固件代码到分销渠道——协同保障,而非依赖单一环节。

cryptonews.ru3小时前

假冒Ledger的内部构造:如何将4G调制解调器秘密植入硬件钱包

cryptonews.ru3小时前

交易

现货

热门文章

如何购买T

欢迎来到HTX.com!我们已经让购买Threshold Network Token(T)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Threshold Network Token(T)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Threshold Network Token(T)购买完您的Threshold Network Token(T)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Threshold Network Token(T)在HTX的现货市场轻松交易Threshold Network Token(T)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

2.1k人学过发布于 2024.07.04更新于 2026.06.02

如何购买T

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对T(T)币价的意见。

活动图片