NovGauge 基准:18 个 LLM 评论文新颖性,幻觉率最高 39%
sethlazar · x · 2026-09-14
复旦等机构研究者发布 NovGauge,一个细粒度诊断 LLM「论文新颖性评审」能力的基准,回应了「用 AI 做同行评审」的提议。
- 数据:619 组论文对 + 50 个多篇论文集合,来源为 ICLR 审稿人的新颖性重叠声明与综述共引,按任务、问题、方法三个维度独立标注。
- 方法:级联诊断流程,逐维度校验判断正确性、证据忠实性与逻辑支持。
- 结果:18 个 LLM 的幻觉率从 0% 到 39% 不等;即便判断正确,超过 70% 的「正确肯定判断」所引用证据在逻辑上无法支持其理由。表现最好的 GPT-5.5 各维度 Verified F1 仅 43–72%,多数模型经验证后 F1 掉到原始值一半以下。
结论:目前最先进的模型在判断论文新颖性上仍不可靠,AI 评审短期内难以胜任新颖性判断。
「模型」频道最新
- 同样是 $20 ChatGPT,为何有人没有 5 小时限制? — noletovictor · 2026-09-14
- Agnes 2.5 Pro Beta 对比 GPT-5.6 Sol:同题 3D 模拟成本 $0.20 vs $1.70 — iamaliveix · 2026-09-14
- Gary Marcus 批 GPT-6 Astra:进步昂贵难出基准,救不了 OpenAI 经济困局 — GaryMarcus · 2026-09-14
- DeepSeek V4.1 Flash 将 KV cache 压到每 token 890 字节 — Prompt Engineering · 2026-09-14
- IndyDevDan 用 5 个基准给 GPT-6 Astra 与 Fable 5.1 排名 — IndyDevDan · 2026-09-14
- 开发者实测 Mercury 2.5:约 13 秒读完病历并纠出 3 处错误 — MaziyarPanahi · 2026-09-14