图表对比 AI 检测器:多数结果接近抛硬币
burkov · x · 2026-07-23
帖子讨论的是AI 生成内容检测工具的准确率,结论非常直接:如果只把任务简化成“AI 写的”与“非 AI 写的”二选一,这些工具的表现并没有比抛硬币好多少。
配图横向比较了多个检测器,包括 Check for AI、Compilatio、Content at Scale、Crossplag、DetectGPT、GPT Zero、OpenAI Text Classifier、Turnitin、Writer、Zero GPT 等。大多数分数都落在大致 50%–70% 区间,少数略高,但整体看不出有哪一个能稳定可靠地胜出。
这条帖子的核心意思是:AI 文本检测仍然是个很脆弱的问题,目前的工具离“可用作严格判定”还有距离。
「研究」频道最新
- 牛津研究称 AI 写作工具会悄然影响公众意见 — SandraWachter5 · 2026-07-23
- 可学习新颖性让多项强化学习任务更快收敛、回报更高 — menhguin · 2026-07-23
- RECAP 让探针核验可解释性,重构分数不再能作假 — Hiskias Dingeto · 2026-07-23
- USC 基准显示 GPT-5.5 主动视觉观察仅得 10.6% — UniversityofSouthernCalifornia · 2026-07-23
- 论文提出用 Gated DeltaNet 线性化 Softmax Attention — bronzeagepapi · 2026-07-23
- 突破 RGB 仿真瓶颈:高斯泼溅实现机器人零样本迁移 — ZeYanjie · 2026-07-23