arXiv禁CS综述:2025非综述LLM稿仍是近6倍

LLM-Generated or Human-Written? Comparing Review and Non-Review Papers on ArXiv

Yanai Elazar, Maria Antoniak

EMNLP 2026

cs.DL, cs.CL, cs.CY

2026-01-20

用两种检测器测arXiv论文的LLM痕迹:CS综述占比更高,但2025年非综述检出量是综述近6倍。

这篇在解决什么

2025 年 10 月 31 日,arXiv 宣布计算机科学分区不再接收未正式发表的综述、survey 和立场论文。理由写得很硬:这类稿里 LLM 生成内容变多,志愿审核员已经超载。公告没有附任何定量证据。

这篇 EMNLP 2026 论文把那条政策拆成两个能算的问题。综述是不是真的比普通研究论文更常被 LLM 写出来?禁令落下去以后,哪些子领域会被切掉一大块?

方法

管线分两段,而且故意只看标题和摘要。作者从 arXiv 内部了解到,初筛就是这么做的:标题摘要过自动分类,标红的再交给人。主分析跟审核员看到的输入对齐,不是偷懒。

第一段把论文分成综述和非综述。两位作者按标题摘要手标了 200 篇,一半带 review、survey、overview 这类词,一半带 experimental、dataset 这类词,Cohen's κ = 0.85。验证集上比了 Llama 3.3、Gemma 2、GPT-OSS、GPT-4o-mini,Gemma 2 的 F1 到 95.6,还能本地跑,就选定它。留出的 140 篇测试集上,Gemma 2 精确率 92.9、召回 91.2、F1 92.0。GPT-4o-mini 测试集同样是 92.0,但闭源。

第二段测 LLM 痕迹,上了两套互不依赖的检测器。

语料来自 Cornell 放到 Kaggle 上的官方 arXiv 快照,截到 2025 年 12 月 15 日。arxiv-domains 覆盖 CS、数学、统计、物理,每月最多 500 篇,合计 124,461 篇。cs-subcategories 覆盖十个最常见的 CS 子类,合计 138,244 篇。2020–2022 用来校准检测器,2023–2025 才是主分析窗口。

结果

CS 里综述确实更常被标成 LLM。Alpha 校正后的队列估计:综述 21.4%,非综述 14.0%。按年看,两边都在涨,缺口没有收。

检测器类型20232025
Alpha综述12.9%28.2%
Alpha非综述6.2%18.9%
Pangram综述7.4%43.3%
Pangram非综述2.7%23.3%

绝对数量把政策理由翻过来了。按 Pangram 外推到 2025 年全年 CS,综述 LLM 稿约 4,783 篇,非综述约 26,801 篇,后者接近前者的 6 倍。同年 CS 综述总量约 1.21 万,非综述约 14.2 万。审核堆里最大的那摊,根本不是综述。

子类之间的代价更不对称。Computers & Society 综述率 49.2%,软件工程 23.4%,计算机视觉只有 2.4%。一刀切禁综述,社会计算方向可能丢掉一半投稿,CV 大约只丢 3%。十个子类里,综述率与 AI 检出率的 Pearson 相关达到 0.886。Crypto & Security 的综述 AI 痕迹最高(Alpha 31.35%,Pangram 24.68%),NLP(cs.CL)最低(22.06% / 10.88%)。用 OpenAlex 主题再切一刀:Safety Research 综述率 59.7%,Education 33.8%,计算力学 2.6%。安全、教育、社会学这些正在跟 AI 社会效应较劲的题目,会被这条政策切得最深。

全文抽检没有推翻趋势。在摘要已被 Pangram 标成 LLM 的 437 篇 CS 论文里,成功抽出全文 430 篇,其中 57.9% 全文仍被标中:非综述 216/365(59.2%),综述 33/65(50.8%)。综述更常只在摘要上露出 AI 味。换成全文口径,2025 年 CS 综述约 26%、非综述约 16% 被标为 LLM,大约是摘要估计的一半,年份上行和两类之间的缺口都还在。

为什么重要

如果目标是给审核员减负,禁综述打偏了。2025 年 CS 被 Pangram 检出的 LLM 稿里,约 85% 是非综述。如果目标是卡生成质量,非综述同样在涨,而且基数大一个数量级。

对投稿人,真正的冲击是学科不对称。社会计算、HCI、安全、教育这些本来就靠综述和立场文组织讨论的方向,会被切得很深;CV 和机器学习几乎无感。政策写的是「整个 CS」,账单却开给少数子社区。

对做检测的人,这篇把「按篇二分类」换成「按组估比例」,并强制用前 LLM 时期校准假阳性。Alpha 在综述上 13.1% 的底噪是个警告:不校正就会把综述的 AI 率系统性抬高,正好配合「综述更脏」的叙事。

这是政策审计,不是新检测算法。代码已公开。两套检测器绝对数字对不齐(2025 CS 综述 Alpha 28.2%、Pangram 43.3%),能信的是方向和数量级,不是某一个百分点。

局限与存疑

论文自己把硬伤写全了。Alpha 吃的是形容词分布,换生成模型、加人工润色都会漂;Rogan-Gladen 还假设假阳性模式不随真实 AI 使用一起变。Pangram 前 LLM 时期零假阳性,但后 LLM 时期没有真值,没人知道 43.3% 里有多少是误杀。

分类器 92.0 F1 已经高了,「综述」这个标签本身却带着 CS 主流的认识论。教程、既有实验又有立场的跨学科论文会被挤到灰色地带。arXiv 审核员大概率也是这套口径,所以这篇在模拟政策,不是给所有子领域一个中立分类。

更大的缺口是数据只覆盖已经挂出来的论文。被拒、被撤、没过审核的那一批看不到。作者向 arXiv 要过提交日志,没要到。现有数字因此更像下限。检测器也分不清「全文代写」和「非母语作者用模型改句子」,政策讨论如果把这两类扔进同一个桶,会偏。

OpenAlex 作者匹配的人工抽查里,20 个作者有 9 个错,多数是同名合并。作者资历和机构国家的结论只放在附录,主文没有拿它撑政策判断,这个克制是对的。

术语

原文与代码

社区讨论

相关论文

全部论文解读