微调模型轻松绕过 AI 检测:Pangram 准确率从 97% 暴跌至 3%
Dr_WhoDo · reddit · 2026-09-16
Reddit 帖子揭示 AI 检测工具在面对微调模型时的巨大盲区。
- Pangram 与 GPTZero 对普通风格化提示的 LLM 检测准确率分别为 97% 和 91%,误报率接近零
- 但面对模仿特定作者或作品集训练的微调模型,Pangram 准确率暴跌至 3%,GPTZero 直接归零
- 市面上已有可针对任意作者文风微调的商业模型,检测方案对此几乎无能为力
作者还引用 Stony Brook、哥伦比亚法学院与 MIT 的研究《Readers Prefer Outputs of AI Trained on Copyrighted Books over Expert Human Writers》——读者反而更喜欢基于版权书籍训练的 AI 文本。结论:检测工具的高分只是针对「平均 LLM 输出」的胜利,商业公司掩盖了方案的根本漏洞。
「模型」频道最新
- 新论文组合持续学习机制,百任务记忆留存率提升28倍 — DanielKhashabi · 2026-09-16
- 疑似 Claude 用量 bug 意外多给额度,用户晒截图并规划新工具 — rudrank · 2026-09-16
- xAI 发布 Grok 4.6:推理代码语音图像视频统一 API — Jasonio · 2026-09-16
- Mozilla 报告:中美 AI 模型能力差距缩至仅 4.4 个月 — External_Mood4719 · 2026-09-16
- Claude 桌面端免费账户惊现 Opus 5,但每天仅限 3 条消息 — AssociationShoddy785 · 2026-09-16
- 开发者感叹:动态输入 200ms 内稳定结构化输出成真 — blixt · 2026-09-16