AI 同行评审实测:GPT-5.5 召回率最高但废话激增

ChenhaoTan · x · 2026-08-14

作者以一项在心理学论文中植入 100 个错误的新基准测试为例,探讨了 AI 同行评审的质量评估问题。测试发现,零样本 GPT-5.5 虽然找出的错误最多(召回率最高),但产生了惊人的 512 条评论,比其他系统多出约 60%。

作者指出,单纯追求召回率等自动化指标并不等同于更好的验证效果,必须结合真实用户的反馈。其 SAI 系统在实现更高召回率的同时,维持了更高的命中率。

所属事件:实测AI同行评审:多模型集成可揪出93%论文错误(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →