换一句提示词,gpt-5.4 新颖性准确率差 52.6 点

Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation

Noy Sternlicht, Simra Shahid, Peter Jansen, Daniel S. Weld, Pao Siangliulue, Tom Hope

cs.CL

2026-10-02

六款模型给研究想法打新颖性,同一对只改一句提示,gpt-5.4 严格准确率就差 52.6 个点,专用评审器还输给最便宜的提示词基线。

这篇在解决什么

自动产生研究想法的系统,包括端到端做科研的 AI scientist 和多智能体改假设,几乎都要报一个数:新想法更「新颖」。这个数多半来自临时搭建的 LLM judge,即让大模型按提示词担任评审。用哪款模型、开不开检索、逐条打还是两两比,都随系统改变,很少单独做检查。

校验多半用小标注集、旧数据或人类论文,和生成想法不是同一分布。录用也代替不了新颖性,录用论文仍可被写成增量。一些会议已停发 novelty 分数。

量尺若随提示词摆动,系统之间的新颖性涨幅就无法比较。

方法

ICLR 2026 的 OpenReview 评审被 claude-opus-4-6 抽成两类原句:明确称贡献原创,或明确称它不原创。泛泛夸奖和「无法判断」都丢弃。高新颖 154 篇须录用、主领域均分位于前 10% 且不低于 6、贡献均分不低于 3,并且多数正向、零负向。低新颖人类论文 145 篇全部相反:拒稿、后 10% 且均分不高于 3.5、贡献均分不高于 2、多数负向、零正向。摘要里的指标和基线胜负先被删掉,避免实验数字变成捷径。

生成侧是 claude-sonnet-4-5 的单轮输出:只有领域名,没有文献和工具。模型发布超过一年,故意避开前沿,让「生成想法整池更不新颖」这一弱标签保守一些。教授盲测 30 对,28 对是 opus-4-6 的错例,约五小时 30 对都选人类想法。这只检查假定有没有明显破绽。

两套数据共用 154 条高新颖想法。Human-Only 用 145 篇人类论文作低分侧,Human+Generated 用 154 条生成想法。pointwise 判断单条新不新,pairwise 在同一领域里判断谁更新。成对都是 154 对;逐条为 299 与 308。

六款 judge 是 gpt-5.1、gpt-5.2、gpt-5.4、sonnet-4-5、opus-4-5 和 opus-4-6,训练截止都早于投稿。评审 2025-11-12 才公开,晚约两个月。参考配置用 high 推理档且不检索:逐条 3 票取多数,成对两种顺序各 3 票,平票记平局。平局在 strict-accuracy 里算错,在 soft-accuracy 里算半分。

每次只改一处。P1 去掉「拼装不算新颖」的护栏,P2 去掉定义。P3 声明顶会评审认定恰好一个新颖,请模型指出哪个;P4 删除该声明,直接问哪个新颖;P5 保留声明,改问哪个更新颖。检索另附 5 篇摘要,截到 2025-03-01,比摘要截止日 2025-09-19 早约六个月,避开待评预印本。低推理档、两栏「目的 | 机制」、取消投票、用更强模型重写低分侧,都按同样方式单变。专用对照为 Idea Novelty Checker、AI-Scientist,以及 gpt-5.6-sol 的不限次 arXiv 检索(推理档 xhigh)。

结果

参考配置的成对 strict-accuracy 如下。人类论文这一档,六款模型处在 74.0 到 83.8,本该最好分的两极也没有接近满分。

模型Human-OnlyHuman+Generated
sonnet-4-574.039.6
opus-4-579.263.0
opus-4-682.586.4
gpt-5.183.863.0
gpt-5.283.876.0
gpt-5.483.177.9

生成想法一进入对照,多数 judge 明显变差。sonnet-4-5 从 74.0 掉到 39.6,低于随机。opus-4-5 与 gpt-5.1 都掉到 63.0。opus-4-6 是例外,为 86.4。

提示词的落差更大。生成对子上 gpt-5.4 的 P3 为 93.5、P4 为 40.9,差 52.6,至少 52.6% 的对子结论相反,且不依赖标签真伪。人类对子上同一次替换大约只差 7 个点(83.1 对 76.0)。P3 把六款都抬高,opus-4-6 到 100.0。P1 在生成对子上伤害全部六款,sonnet-4-5 掉到 18.2;人类对子上它掉 9.7,其余变动不超过 2 个点。

检索增益有限。最大显著提升是 opus-4-5 的 +15.6(63.0 到 78.6),gpt-5.4 则降 5.2。gpt-5.6-sol 不限次检索的 macro-F1(两类 F1 的平均)为 0.78,低于五篇摘要条件下的 opus-4-6(0.889)约 11 个点,花费却约有 10 倍。检索也能把判对的组合改口成现有原料的拼接。

推理档降到 low,最多约掉 7 个点,偶尔还会变好。平局很多:opus-4-6 某些配置打平 35%,sonnet-4-5 超过一半,而且这两款在生成对子上的平局约是人类对子的两倍。取消投票还可能把平局率再翻倍。strict 与 soft 两种计分会改排名。

专用器没有更准。opus-4-6 上最便宜的提示词领先两个专用器 8 到 29 个 macro-F1,最多便宜约 32 倍。gpt-5.4 上同样全部领先,大约便宜 6 倍。改成统一两栏后,有的改动翻掉三分之二以上的判决。低分侧用更强模型重写,准确率仍会低于随机。

为什么重要

出点子系统报出的新颖性涨幅,就建立在这种 judge 上。一句提示让 gpt-5.4 差出 52.6 个点,换一个骨干却可能几乎无感。人类论文上大约只有 7 个点的波动,生成想法上才是 52.6,而后者才是使用场景。

检索、加长推理、专用模型和代理搜索都没有把判断做稳,最便宜的提示词基线反而更准。继续用 LLM 报告新颖性,至少要在生成想法上扫描提示词和骨干,并分开报告平局。现有自动新颖性分数撑不住系统间对比。

局限与存疑

生成侧不是逐条金标。30 对里 28 对挑自最强 judge 的错题,专家只有一位。绝对分数要连同池级假定一起看。配置互相反驳,则不必依赖标签。

P3 把「恰好一个新颖」说给了模型。opus-4-6 因此打到 100.0,有可能主要在区分会议摘要和单轮生成。两栏改写后波动还在,但满分是否留下,正文没有报告。P3 与 P4 也不是同义句。

评审读的是全文,judge 读去掉数字的摘要,两边对不齐。样本只留评分两头,相近想法没有测。两头都不稳,中段不会更好分,准确率也不能外推。抽取用的是 opus-4-6,数据只有 ICLR 2026。

术语

原文与代码

社区讨论

相关论文

全部论文解读