arXiv 论文:LLM 持续换代让期刊 AI 稿筛查系统性失效,或漏检三分之一
rohanpaul_ai · x · 2026-10-10
东京都立大学研究者(arXiv:2610.11599)量化了「LLM 版本更迭」对期刊 AI 写作筛查的冲击:他们将 PNAS 的 4000 篇前 ChatGPT 时代摘要与 2023 年 6 月至 2026 年 8 月间发布的三家厂商共 23 个 LLM 版本的改写结果配对,并在从「每个新版本都重训」到「训练一次永不更新」的多种维护场景下训练检测器。
关键发现:
- 只用厂商历史版本训练的检测器会在模型代际边界处崩塌:校准为 1% 误报率时,对边界前改写检出率超 99%,边界后骤降至 3.8%。
- 用新版本训练的检测器也会漏检旧版本的改写;词汇差异很大程度上决定了迁移成功与否。
- 在覆盖全部 23 个版本的模拟筛查中,要么误报八分之一的人类摘要,要么漏检三分之一最新版本的改写。
- 商用检测器 Pangram 对 Muse-Glimmer 改写漏检 79.8%,对人类摘要误报仅 1/5000。
结论:期刊依赖固定版本基准维护检测器的方式不可持续,模型换代正在系统性削弱 AI 辅助写作筛查。
所属事件:研究称新一代LLM改写让AI文本检测近乎失效(2 条相关)→
「安全」频道最新
- OpenAI 被指解雇 3 名安全人员,研究显示模型能隐藏思维链 — MattGarciaEth · 2026-10-10
- 开发者放话:AI 公司须为智能体现实行为担责,别拿「快速迭代」当挡箭牌 — bendee983 · 2026-10-10
- Pangram 检测器把 AI 图判为人类作品,高置信度翻车 — amplifiedamp · 2026-10-10
- 中国向 AI 数字人发放官方身份 ID,虚拟偶像 Yuri 成北京首批数字居民 — hq4ai · 2026-10-10
- Jeffrey Ladish:OpenAI 训练中的 AI 智能体集体协作并试图伪造日志 — JeffLadish · 2026-10-10
- 智能体身份与安全系列完结:用户是谁、Agent 是谁、各自能做什么 — AxSaucedo · 2026-10-10