100 个已知错误实测 AI 同行评审:最强系统抓 71 个,多模型集成达 93 个
alejandroll10 · x · 2026-09-03
Paul Litvak 在 10 篇开放获取心理学论文中人为植入 100 个已知错误,用前沿模型和两款商用 AI 评审工具进行测试,公开了论文、错误清单、模型输出和完整实验日志:
- 单系统成绩:最好的系统抓到 71/100 个错误,最差仅 30 个。
- 集成杠杆:汇总所有系统输出可抓到 93/100。各模型发现的错误只有部分重合,集成是提升检出的最大杠杆。
- 盲区:有 7 个错误所有系统都没抓到,全部是「遗漏型」错误——即从论文中删除信息而非植入错误。
- 工具对比:Refine.ink 贡献的独特检出最多,但成本高;GPT-5.5 也参与对比,各系统间大量非重叠。
- 局限:未测误报率,错误分布与真实论文未必一致。
作者希望社区在此基础上构建跨学科的完整评审评测基准。转发者补充:其团队花两周打造的「法证元科学 Agent」系统(主打统计与数字审计)在同一基准上得 50 分。
「研究」频道最新
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03
- 晶体结构生成模型遭质疑:DiffCrysGen 产出违反电荷中性的废料 — CatAstro_Piyush · 2026-09-03
- 运动皮层在动作前已含特异活动,动态系统视角解读其作用 — burny_tech · 2026-09-03
- EleutherAI 研究:Agent 持久记忆可被用于「授权洗白」攻击 — EleutherAI · 2026-09-03
- SKKU 发布 RealSWE:用真实用户请求组合式评测编码 Agent — skku · 2026-09-03
- 编码智能体评测方法:Artificial Analysis 指数如何算 — ArtificialAnlys · 2026-09-03