Pangram 回应质疑:误报率在测试集上测量,长文本几乎零误报
cephaloform · x · 2026-09-23
- AI 文本检测公司 Pangram 的负责人回应关于检测器误报的质疑:公司报告的不是训练集得分,而是在通用互联网文本测试集加一组用户关注的 benchmark 上的假阳性率。
- 承认数据漂移是潜在风险——人们现在的写作风格已开始「像 AI」,但称未观察到现代文本上误报率升高的证据。
- 强调文本长度是关键变量:见过推文或几段长度的真实误报,但从未见过覆盖整章书的误报,即便检查过大量书籍。
「模型」频道最新
- Anthropic 发布 Claude Opus 5.5,价格比 Opus 5 低 40% — TAbrodi · 2026-09-23
- 100 项多智能体评测:Grok 4.7 解法有洞见但语法错误多,作者判为 flop — teortaxesTex · 2026-09-23
- GPT-6 传闻代号 Sol,网友追问会不会登陆 ChatGPT — flowersslop · 2026-09-23
- 传 Claude Opus 5.5 对前沿开发任务自动降级到弱模型,引热议 — basedjensen · 2026-09-23
- Higgsfield 对比实测:Opus 5.5 的 3D 武士游戏明显胜过 GPT-6 Astra — VraserX · 2026-09-23
- 给 Opus 5.5 接上创作工具后问它梦见什么,回答很有料 — angrypenguinPNG · 2026-09-23