NovGauge 基准:18 个 LLM 评论文新颖性,幻觉率最高 39%

sethlazar · x · 2026-09-14

复旦等机构研究者发布 NovGauge,一个细粒度诊断 LLM「论文新颖性评审」能力的基准,回应了「用 AI 做同行评审」的提议。

结论:目前最先进的模型在判断论文新颖性上仍不可靠,AI 评审短期内难以胜任新颖性判断。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →