实测 6 款开源 AI 文本检测器:4 款做不到 0.5% 误报率,改写后集体失效
grumpyp2 · reddit · 2026-09-02
一个团队用统一协议实测了所有知名开源 AI 文本检测器,结果揭示了整个品类的系统性缺陷:
- 协议:公开数据(NBER 研究、TOEFL 作文、1060 篇 GPT-5.x/Claude/Gemini 3.x 前沿文本、5000 篇 2018 年前 FineWeb 人类文本),每款模型先在同一批 6930 篇人类文档上校准阈值到 0.5% 误报率,再测各类召回率。
- 误报率都压不住:6 款中 4 款根本达不到 0.5% FPR;MAGE 对 26% 的普通人类网页文本给出 >0.9999 分;旧版 OpenAI RoBERTa 检测器 AUC 仅 0.31,对现代生成器比抛硬币还差。
- humanizer 改写是全军覆没点:最好的模型只抓出 42%,第二名仅 4%。
- 系统性偏见:所有模型都过度标记非母语者的 TOEFL 作文,是品类通病而非单模型 bug。
榜单第一名 tropa-mini(Roc-AUC 0.968)是作者自家产品,已按 Apache-2.0 开放权重,数据与方法全公开可复现。
「模型」频道最新
- Fable 5.1 号称省 45%,重度用户反称额度一小时烧光 — heypearlai · 2026-09-02
- Astra 安全数据反直觉:能力更强,违规攻击行为却降为零 — VoidStateKate · 2026-09-02
- 训练中知识蒸馏偏科:推理提升,事实记忆反受损 — roydanroy · 2026-09-02
- ArgMaxRL 提出新梯度估计器,同时优化所有 best@k 缓解模式坍缩 — fpedregosa · 2026-09-02
- 递归可省算力:10T 递归模型或匹敌 13-17T 稠密模型 — scaling01 · 2026-09-02
- Claude 电脑操作任务实测翻车,视频记录全过程 — CtrlAltDwayne · 2026-09-02