新智元报道
三分之一的arXiv论文,竟然是AI写的?
最近,unslop发布的一份研究报告在外网引发了剧烈震荡。
数据显示,在过去一年里,该检测器将计算机科学领域65%的新论文标记为疑似AI生成。
这一结果甚至让网友创造了「大泔水时代」这个专有名词。
但讽刺的是,同一时期内,数学领域的标记率仅为0.7%。
ChatGPT一响,曲线原地起飞
这项研究的数据池相当庞大:团队梳理了12750篇arXiv论文,时间线从2023年1月一直延伸到2026年7月。
为了得出有效结论,研究覆盖了十个学科,每个领域每月随机抽取约25篇全文作为样本。
为了对比自然状态下的写作特征,对照组选取了2021至2022年的数据——那是ChatGPT尚未问世、纯人类写作的时代。
数据变化直观得惊人。
在2021至2022年间,AI标记率始终维持在0.4%的低水平;然而随着ChatGPT的发布,这条曲线在短短几个月内呈指数级攀升。
在最近一个完整的季度中,整体标记率冲到了32%;而到了2026年初,峰值更是逼近39%。
细分到各个学科,计算机科学的状况最为严峻,标记率高达65%。
回想一下,在ChatGPT出现之前,这一数值仅仅只有0.2%。短短三年间,数字翻了300多倍。
紧随其后的是定量生物学(56.3%)、电气工程(51.3%)以及经济金融(47%)。
再往下依次是应用物理(34%)、统计学(31.3%)、凝聚态物理(24%)、高能物理(14%)和天体物理(10.7%)。
榜单的末尾是数学,仅有0.7%。
使用同一套检测标准,面对同一个论文库,最大落差竟接近100倍。
这不禁让人疑惑:是数学家们集体坚守手工码字?还是这台机器在面对数学公式时,根本就是个瞎子?
跌入谷底的0.7%,是机器致盲
其实,unslop自己在报告里已经给出了答案。
一篇标准的数学论文是什么样?满屏充斥着符号、公式、定理和证明过程,真正用英语写成的叙述性文字寥寥无几。
问题在于,当前的检测器只识别文本特征。它依赖句子结构、用词习惯和段落逻辑来判断。
而在数学论文里,剩下的那几行文字大多是「设X为某某」「由引理3可推导」这类高度格式化的表达,与检测器训练数据中的科学英语并不在一个频道上。
因此,团队坦承目前的研究存在明显局限:
首先,数学领域0.7%的低占比无法定论。这可能是数学家真的很少使用AI,也可能是检测器看不懂数学内容,但现有数据无法区分这两种可能性。
其次,对照组样本量偏小。每个学科仅包含200篇ChatGPT之前的论文。按0.4%的误报率计算,2000篇中总共才8篇被标记。这种规模只能提供粗略估计。
最后,如前所述,检测器存在漏检现象。这意味着上述数据只是下限,真实的AI写作比例只会更高。
越卷的地方,越离不开AI
究竟是谁在大规模使用AI写论文?
斯坦福大学另一组历时两年的监测数据揭示了真相。
2024年3月,斯坦福Weixin Liang团队首次将审视目光投向同行评审环节:在ICLR 2024的审稿意见中,约有10.6%的句子被大型语言模型大幅修改过。也就是说,论文还没最终定型,审稿人自己已经先动用了AI工具。
2025年8月,同一团队将样本量扩大至112万篇论文,研究成果直接发表于《自然·人类行为》期刊。
研究显示,截至2024年9月,计算机科学论文摘要中被LLM修改的比例最高已达22.5%。
值得注意的是,使用频率最高的群体,正是那些发预印本最勤快、身处最内卷领域的研究者。
领域越卷,对AI的依赖就越深。
在这里,AI写作演变成了一场军备竞赛:当同行都在利用AI提速时,坚持手写的人节奏必然慢半拍。
难怪这份报告在X平台上流传甚广的一条转发中,配文第一行赫然写着:「提示词:写一篇能发arXiv的论文。」
它闻的是「味」,不是AI
不过,暂且别急着拿65%这个数字去给人定罪。
报告明确指出,检测器无法区分「AI顺过一遍语法」和「整篇由机器代工」,它捕捉的只是文字中所谓的「机器味浓度」。
所以,65%的正确解读应该是「65%的论文闻起来像AI」,而非「65%的论文是AI写的」。
麻烦之处在于,这种「机器味」人类作者也会沾染。
曾有不信邪的研究者,将自己多年前的旧论文投入检测工具,结果27%至74%的内容被标红。
要知道在那个年代,ChatGPT的影子都还没出现。
原因显而易见。
翻看当下的学术期刊,满纸都是大型语言模型、基准测试、业界最前沿等词汇。措辞越规范,结构越严谨,越容易触发检测器认定的机器特征。
更何况,LLM本身就是基于这类学术文献训练出来的。并非学者写得像AI,而是AI生来就模仿得像学者。
当所有文字都有了嫌疑
事实上,过去两年我们一直在做和检测器类似的事情。
读到一段四平八稳、词句工整、充斥着「不仅……而且……」结构的文字时,心里难免咯噔一下:这怕不是AI写的吧?
unslop的检测器,不过是把这种玄学的直觉,转化成了可量产的数字指标。
毕竟,怀疑一旦植入脑海,便难以移除。
过去,「写下来」本身就是一种背书。一个人愿意花费数小时组织文字,至少证明他态度认真。
如今,无论文章写得多么漂亮,都可能只换来一句「肯定是AI生成的」。
有些人甚至开始刻意避开自己用了半辈子的词汇,只因它们「听起来太像AI」。
现在,「AI味」正演变为一场席卷文字圈的新型原罪。
滑稽的是,直到今天,我们连构成这股原罪的具体要素是什么,都未能精确测量出来。
参考资料:
https://unslop.run/blog/measuring-ai-writing-on-arxiv
编辑:摩西
秒追ASI
