100 个已知错误实测 AI 同行评审:最强系统抓 71 个,多模型集成达 93 个

alejandroll10 · x · 2026-09-03

Paul Litvak 在 10 篇开放获取心理学论文中人为植入 100 个已知错误,用前沿模型和两款商用 AI 评审工具进行测试,公开了论文、错误清单、模型输出和完整实验日志:

作者希望社区在此基础上构建跨学科的完整评审评测基准。转发者补充:其团队花两周打造的「法证元科学 Agent」系统(主打统计与数字审计)在同一基准上得 50 分。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →