图表对比 AI 检测器:多数结果接近抛硬币

burkov · x · 2026-07-23

帖子讨论的是AI 生成内容检测工具的准确率,结论非常直接:如果只把任务简化成“AI 写的”与“非 AI 写的”二选一,这些工具的表现并没有比抛硬币好多少。

配图横向比较了多个检测器,包括 Check for AI、Compilatio、Content at Scale、Crossplag、DetectGPT、GPT Zero、OpenAI Text Classifier、Turnitin、Writer、Zero GPT 等。大多数分数都落在大致 50%–70% 区间,少数略高,但整体看不出有哪一个能稳定可靠地胜出。

这条帖子的核心意思是:AI 文本检测仍然是个很脆弱的问题,目前的工具离“可用作严格判定”还有距离。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →