LLM 一换代,AI 文本检测就崩:检出率从 99% 跌到 3.8%

Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing

Kazuki Nakajima, Takayuki Mizuno

cs.CL, cs.AI, cs.CY, cs.DL, cs.SI

2026-10-08

23 个 LLM 版本改写 4000 篇 PNAS 摘要:模型一跨代,检出率从 99% 崩到 3.8%,商用检测器漏检最新版本八成改写。

这篇在解决什么

期刊和会议已经开始用 AI 文本检测器筛查投稿,而且动真格:2026 年一家头部 CS 会议用商用检测器扫了某个 track 的全部投稿,不经评审直接拒掉 178 篇,占该 track 的 18.4%;NeurIPS 2026 的 position paper track 也与检测产品 Pangram 合作筛查。这些决策押着一个假设:检测器在 benchmark 上的准确率能延续到线上。但 benchmark 里的 LLM 版本是固定的,作者手里的模型在不停换代,这种磨损此前没有人在真实维护条件下量化过。

方法

取 4,000 篇 ChatGPT 之前的 PNAS 摘要(2009-2018,四个学科域各 1,000 篇),让 OpenAI、Meta、Alibaba 三家的 23 个 LLM 版本逐篇改写(2023 年 6 月到 2026 年 8 月,从 GPT-4、Llama 3.1、Qwen2.5 一路到 GPT-5.6 Terra、Muse-Glimmer、Qwen3.8)。改写用两段式 prompt,先把摘要压缩成要点,再扩写回一段摘要,保留 91,953 篇改写稿。

检测器统一用微调的 RoBERTa-base(1.25 亿参数的预训练语言模型),阈值在 30,925 篇从未参与训练的人类摘要上校准,把误伤人类文本的比例(FPR)钉在 1%。关键变量是维护方式,四种场景:current,在目标版本自己身上训练,理想情况;past + current,新版本一出就重训;past only,只拿同厂商旧版本训练,这是新模型文本先到、训练数据未到的常态;frozen,只训一次,冻结在各家最早版本。之上再叠两种筛查架构:union 给 23 个版本各配一个检测器,任一报警即标记;pooled 把全部版本混训成一个检测器。商用产品 Pangram 走 API 直测。

结果

方法指标结果
current version(23 版中位)检出率 @1% FPR99.9%
past + current检出率 @1% FPR99.3%
past only检出率 @1% FPR中位 95.4%;GPT-5 崩到 26.6%,Muse-Glimmer 崩到 3.8%
冻结在 GPT-4对 GPT-5 及以后最高只抓 0.6%
GPT-4o 检测器测 Llama 3.3检出率99.5%(跨厂商同代可迁移)
GPT-4 检测器测 GPT-5.4检出率0.2%(同厂商跨代失效)
union 筛查误伤人类摘要11.9%,约八分之一
pooled 筛查漏检 Muse-Glimmer33.8%,约三分之一(中位漏检仅 2.8%)
Pangram误伤 / 漏检 Muse-Glimmer0.02%(5,000 篇错 1 篇)/ 79.8%

四个结构性发现:

为什么重要

对科研管理机构,结论很具体:检测器的 benchmark 准确率只是临时有效,每次 LLM 发布都要重验,旧版本也在回测范围内。词频 JSD 是个实用预警信号,只需要新模型的一批改写样本,不需要参数和架构信息,而这些对主流闭源版本根本拿不到。

对做检测系统的人,教训是固定模型池上的高分不等于线上扛得住换代。失效点是代际边界,这比「模型越新越难测」的直觉更具体,也更可操作。

局限与存疑

作者自述:单一期刊(PNAS)、单一语言、单一文体(摘要);LLM 使用被模拟成固定两段式改写,真实用法从改语法到全文重写差异很大;检测器只测了 RoBERTa-base 一族加一个商用产品的固定档位;三家厂商,Anthropic 因使用条款被排除;JSD 与迁移的关联是相关不是因果。读下来再补两点:四个公开检测器(Binoculars、FastDetectGPT 等)不做领域内训练时,每个版本的改写都漏三分之二以上,这项研究自训检测器、同域训练同域判卷,设定已偏宽松,线上崩溃只会更狠;Pangram 测的是 3.3.2 版,该版本 2026 年 9 月 30 日已下线,新版行为未知。

术语

原文与代码

社区讨论

相关论文

全部论文解读