第三方检测器复测 NeurIPS 论文 AI 检测:两工具结果分歧明显
AltruisticCouple3491 · reddit · 2026-10-08
- 背景:NeurIPS 曾用 Pangram 3.3.2 筛查立场论文,一篇商业 AI 检测器 ParaTrace 的开发者用自家 v7 复测了同一批 2022(ChatGPT 之前)与 2025 年论文。
- 2022 年对照:两款检测器均未标记任何论文,ParaTrace 在 4,512 个段落中仅 0.4% 判为 AI,论文级假阳性 95% 上限约 3.5%。
- 2025 年分歧:≥90% 阈值下两者各标 2 篇;但 ≥50% 时 ParaTrace 标出 123 篇中的 9 篇(7.3%),Pangram 只标约 2/204(1.0%)。
- 可能解释:作者列出四种可能——Pangram 漏报 AI 辅助写作;ParaTrace 按设计把 AI 润色的人写文本也判为 AI(其测试中 42.8% 被 AI 改写的人写文本会被标记,而 NeurIPS 允许 AI 文字编辑);2025 年人类写作中的假阳性;分块大小差异。
- 公开测试集对比:在 Pangram 4 的公开测试上,ParaTrace 在纯 AI 文本上持平(全 AI 文章 100% 检出),短文本落后(50 词以下 73% vs 99.7%),经 humanizer 处理后大幅落后(21% vs 99%),默认设置假阳性也更高(1.86% vs 0%)。
- 结论:目前 AI 文本检测没有真值,检测器之间在「AI 润色」这类灰色地带分歧显著,据此处罚论文有风险。
「安全」频道最新
- 三名被解雇的 OpenAI 安全研究员致信董事会,要求保留思维链监督 — mark_k · 2026-10-08
- 欧洲职场 AI 监控引关注:Multiverse 员工称系统「令人不安」 — nordicinst · 2026-10-08
- 研究者:reward hacking 或指向模型更深层的对齐问题 — gleech · 2026-10-08
- 六年前诞生的 spec gaming 案例集:原始 AI 的脑洞钻空实录 — gleech · 2026-10-08
- 610 个 reward hacking 案例人工标注:逾百例无环境缺陷 — gleech · 2026-10-08
- 浏览器每次访问都在泄露指纹:时区、屏幕、GPU 拼出唯一身份 — nikola_mr64990 · 2026-10-08