实测 AI 同行评审:集成多模型可揪出 93% 的论文预设错误

ChenhaoTan · x · 2026-08-14

一项针对 AI 同行评审工具的深度评估指出,单一 AI 系统在识别论文错误时的表现差异巨大(最佳能发现 71 个预设错误,最差仅 30 个)。研究发现,由于不同模型发现错误的相关性较低,集成多个模型的输出是一个巨大的杠杆,能够抓出 93% 的预设错误。然而,所有系统都无法检测出通过“删除信息”造成的遗漏型错误。此外,商业工具 Refine.ink 贡献了最多的独特发现,但使用成本较高。

所属事件:实测AI同行评审:多模型集成可揪出93%论文错误(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →