1636 次测试:人类仅 64% 正确率识破 AI 改写文本
dejanseo · x · 2026-10-09
- dejan.ai 的 AI vs Human 测试前两天收集 1636 份答案,总体正确率 64%(高于瞎猜的 50%);142 个完成轮次中 18 轮全对,而纯猜测预期仅 0.14 轮全对。
- 测试方式:每轮 10 条新闻,每条给记者原文与 LLM 改写版两段摘录(各 30–120 词、取自正文中部三句),由玩家点选哪段是机器写的;正确答案存于服务器端,每轮生成永久成绩页与排行榜。
- 数据中最强的影响因素是阅读时长:5 秒内作答正确率 55%,40 秒以上作答正确率升至 75%——读得越久越容易识破 AI 文本。
- 语料库含 1 万组匹配文本对,避开开头结尾等套路破绽密集区,使测试更贴近真实阅读场景。
「研究」频道最新
- Looped 模型或能抵御蒸馏攻击:推理藏在潜空间而非可见 CoT — moyix · 2026-10-09
- LLM-as-a-Verifier 开源:弱模型验证强模型,Terminal-Bench 达 69.2% SOTA — Azaliamirh · 2026-10-09
- Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6% — Salesforce · 2026-10-09
- Claude 声称发现 500 光年外一对红矮星双星系统 — nitarshan · 2026-10-09
- Prompt tuning 被集体遗忘,微调 token 或被严重低估 — cephaloform · 2026-10-09
- Baeza-Yates 演讲:机器学习模型评估何时能不再自欺 — PolarBearby · 2026-10-09