实测AI同行评审:多模型集成可揪出93%论文错误
一项针对AI同行评审工具的深度评估显示,单一模型在识别论文错误时表现差异巨大,最佳仅能发现71个预设错误。虽然零样本GPT-5.5召回率最高,但生成的无效评论也大幅增加。研究发现,由于不同模型发现错误的相关性较低,采用集成多模型的方法效果显著,能够成功识别出高达93%的预设错误。
2026-08-14 ~ 2026-08-14 · 2 条相关
- 实测 AI 同行评审:集成多模型可揪出 93% 的论文预设错误 — ChenhaoTan · 2026-08-14
- AI 同行评审实测:GPT-5.5 召回率最高但废话激增 — ChenhaoTan · 2026-08-14