三分之一arXiv沦陷,CS论文65%被判“AI味”,数学仅0.7%

marsbit发布于2026-07-27更新于2026-07-27

文章摘要

一项研究对arXiv预印本网站上的论文进行了AI文本检测,发现自ChatGPT发布后,AI生成或修改文本的比例急剧上升。在2026年初,近39%的新论文被检测器标记出“AI味”。学科差异显著:计算机科学领域高达65%,而数学领域仅0.7%。研究者指出,低标记率可能源于数学论文包含大量公式,检测器主要分析文字风格,因此结果存在局限。同时,检测器无法区分轻度润色和完全代笔,且学术写作本身的规范风格易被误判为“AI味”。这引发了关于文字真实性信任危机和“AI味”成为新型评判标准的讨论。真实AI使用比例可能更高,数据仅为下限。

三分之一的arXiv论文,竟然是AI写的?

就在最近,一项unslop的研究在外网炸开了锅。

过去一年,计算机科学领域65%的新论文,被它的检测器标了红。

网友甚至为此造了一个专属名词——「大泔水时代」。

可同一时期的数学论文,却只有0.7%。

ChatGPT一响,曲线原地起飞

在这项研究中,团队扫了12750篇arXiv论文,时间跨度从2023年1月直抵2026年7月。

目标锁定十个学科,每个领域每月抽取约25篇全文。

对照组则选定在2021至2022年,那是ChatGPT还未降生的纯人类时代。

结果显示,2021至2022年,标记率稳定在0.4%;但随着ChatGPT的发布,曲线在几个月内拔地而起。

在最近一个完整季度中,标记率达到了32%,而在2026年初,峰值更是逼近39%。

分学科来看,计算机科学最为惨烈,标记率高达65%。

要知道在ChatGPT问世前,它的基准值只有0.2%。短短三年,数字狂飙了300多倍。

紧随其后的是定量生物学56.3%,电气工程51.3%,经济与金融47%;再往下,应用物理34%,统计31.3%,凝聚态物理24%,高能物理14%,天体物理10.7%。

榜单的最后一行是数学:0.7%。

而这还只是下限。如果把AI文本藏得足够隐蔽,检测器是识别不出来的。

同一台检测仪,同一个论文库,落差逼近100倍。

到底是数学家集体坚守纯手工码字?还是这台机器在数学公式面前,压根就是个瞎子?

跌入谷底的0.7%,是机器致盲

其实,谜底已经被unslop亲手写进了报告里。

想想看,一篇标准的数学论文究竟长什么样?满屏都是符号、公式、定理与证明,真正用英语写成的散文句子,少得可怜。

偏偏这台检测器只认文字。它盯的是句子的结构、用词的习惯、段落的组织。

而数学论文里仅剩的那几行字,还全是「设X为某某」「由引理3可推导」这类格式化表达,和检测器训练时见过的科学英语基本不在同一个频道上。

所以团队自己也承认,目前的研究还有不少局限性:

数学的0.7%目前还说明不了什么。可能是数学家真不怎么用AI,也可能是检测器看不懂数学论文,但这份数据分不出是哪一种。

对照组也比较小。每个学科只有200篇ChatGPT前的论文,按0.4%的误报率,2000篇里总共只有8篇被标记。这种水平,只能算是粗略估计。

再有就是前面说过的,检测器抓不全。所以,这些数字都还只是下限,真实比例只会更高。

越卷的地方,越离不开AI

那么,到底是谁在用AI写论文?

答案,藏在斯坦福另一项持续了两年的研究里。

2024年3月,斯坦福Weixin Liang团队率先把尺子伸进同行评审:ICLR 2024的审稿意见里,约10.6%的句子被LLM大幅修改过。论文还没测完,审稿人自己先用上了。

2025年8月,还是这个团队,把样本扩到112万篇论文,并且直接登上了《自然·人类行为》。

研究显示,截至2024年9月,CS论文摘要的LLM修改比例最高已达22.5%。而且用得最狠的,是发预印本最勤、扎在最卷领域的研究者。

越卷的领域,用得越狠。

在这里,AI写作已经成为了军备竞赛:同行都在用AI提速,只用手写的人,节奏就慢了一拍。

难怪X上一条流传颇广的相关转发,配文里第一行就是:「提示词:写一篇能发arXiv的论文。」

它闻的是「味」,不是AI

不过,先别急着拿这65%去定罪。

团队在报告里也承认,检测器分不清「AI顺过一遍语法」和「整篇机器代工」,它只认文字里的机器味浓度。

所以65%的正确理解,是「65%的论文闻起来像AI」,而不是「65%的论文是AI写的」。

但麻烦在于,这种机器味,人类自己也会沾染。

有不信邪的研究者,把自己多年前的旧论文扔进检测工具,结果27%到74%的内容被标红。

要知道在那个年代,ChatGPT连个影子都还没有。

原因不难找。

翻开今天的学术期刊,满纸都是大型语言模型、基准测试、业界最前沿。措辞越标准,结构越工整,越容易撞上检测器认定的机器特征。

何况,LLM本来就是拿这类论文训练出来的。不是学者写得像AI,是AI生来就写得像学者。

当所有文字都有了嫌疑

其实这两年,我们都在干和检测器同一件事。

读到一段四平八稳、词句工整、时不时蹦出「不仅......而且......」的文字,心里就会咯噔一下:这怕不是AI写的吧?

unslop的检测器,等于把这种玄学的嗅觉,做成了一台能量产数字的仪器。

毕竟怀疑一旦装进脑子,就卸不掉了。

过去,「写下来」本身就是一种背书。一个人愿意花几个小时组织文字,至少说明他认真。

现在写得再漂亮,都可能只换来一句「AI吧」。

有些人甚至开始刻意绕开自己用了半辈子的词,只因它们「听起来太AI」。

如今,「AI味」正在变成一场席卷文字圈的新型原罪。

滑稽的是,直到今天,我们连这种「AI味」究竟由什么构成,都还没能精确测量出来。

本文来自微信公众号“新智元”,作者:ASI启示录

热门币种推荐

相关问答

Q根据研究,2026年初arXiv论文的AI文本检测标记率峰值是多少?

A根据研究,在2026年初,arXiv论文的AI文本检测标记率峰值逼近39%。

Q研究中,哪个学科的论文被检测器标记为具有“AI味”的比例最高,具体是多少?

A研究中,计算机科学领域的论文被检测器标记的比例最高,达到了65%。

Q为什么文章说数学论文0.7%的标记率可能无法真实反映AI使用情况?

A因为数学论文主要由符号、公式和定理证明构成,自然语言文本很少,且多为格式化表达。检测器主要针对文字结构和用词习惯进行检测,因此可能无法有效识别数学论文中的AI生成或修改内容,所以这个数据存在局限性。

Q斯坦福的研究发现,AI写作工具的使用与研究领域的竞争激烈程度有什么关系?

A斯坦福的研究发现,在同行竞争越激烈、发表压力越大的研究领域,研究者使用AI写作工具(如LLM修改文本)的比例就越高,这已经成为一种“军备竞赛”式的普遍现象。

Q文章指出当前的AI文本检测器存在什么主要问题或局限?

A当前的AI文本检测器主要存在以下几个局限:1. 只能检测文字中的“AI味”或机器特征,无法区分是AI辅助润色还是AI全文生成。2. 对人类撰写的、符合学术规范的标准化学术语言也可能误报。3. 对于数学等符号公式占主导的文本,检测能力很弱。4. 检测结果只反映了AI文本的下限,真实比例可能更高。

你可能也喜欢

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击,许多人担心工作被取代。然而,真正的威胁在于个人对他人和系统的依赖,以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键,不是抵制技术,而是成为拥有高自主性的“不可受雇”个体。 文章提出了成功抵御AI替代的五个核心要素:自主性(主动行动的能力)、品味(判断事物价值的经验)、说服力(让他人关注你工作的能力)、毅力(坚持并从错误中学习)和迭代(根据反馈持续改进)。这些能力无法仅通过理论学习获得,必须通过实践来培养。 要启动转变,首先要彻底改变环境,重塑身份认同。其次,应选择一个能获得真实、快速反馈的实践领域,例如创业。在众多技能中,内容创作(媒体)比编写代码更具优势,因为其价值是主观的,需要独特的审美和判断力,这正是AI目前难以完全复制的。 具体行动上,可以从三个步骤开始: 1. **挖掘原始素材**:反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣,找到独特的个人经验。 2. **确立反向思考主轴**:找出你坚信但主流观点错误的地方,或行业内普遍忽视的“皇帝新衣”,形成独特的批判性视角。 3. **立即发布**:将前两步的思考融合,撰写并发布第一个核心内容(如帖子、视频),勇敢接受真实世界的反馈,并在此基础上持续学习和迭代。 最终,抵御AI的关键在于构建一份与自身身份深度契合的毕生事业,通过持续的内容创作和真实互动,建立无法被自动化取代的独特价值和影响力。行动,从今天发布第一个想法开始。

marsbit4小时前

如何让自己变得让人工智能永远也无法取代

marsbit4小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下: **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定,理论上虽可预测,但实践中无法被攻击者复制或计算,从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵,50次投掷即可满足典型12词助记词(128比特熵)的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷,致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响,因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示:手工种子并非万能保护** 安全研究员指出,即使用户使用骰子生成了安全的种子,若他们使用了Coldcard的其他功能(如生成纸钱包、克隆密钥、共享签名密钥、密码等),这些**衍生密钥**仍可能调用有漏洞的随机数生成器,从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠,但该方法对大多数用户并不友好: * **过程繁琐易错**:需投掷50-99次,精确记录,任何输入错误都会导致钱包完全不同。 * **引入新风险**:用户可能在记录、转换过程中泄露信息,或使用有偏的骰子/投掷方式。 * **用户体验差**:难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应: * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码,如有则需立即更换。 * 考虑采用多签方案,使用不同厂商的设备分散风险。 **结论**:手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项,但其过程复杂、容易出错,不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru7小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

cryptonews.ru7小时前

交易

现货

热门文章

从H2A到A2A:AI Agent经济体与Crypto新机遇

6月17日,哈佛大学独立研究员、美国AI科学院(NAAI)通讯院士、比特币基金会终身会员韩锋做客火币HTX《大咖讲堂》第三期,以《从H2A到A2A》为主题,分享了其对Agent经济、Crypto基础设施及数字社会未来发展的思考。

533人学过发布于 2026.07.01更新于 2026.07.01

从H2A到A2A:AI Agent经济体与Crypto新机遇

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.5k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片