研究揭示 LLM 当「新颖性评审」极不稳定,判定结果随设计选择剧烈波动
_akhaliq · x · 2026-10-09
论文《Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation》(arXiv:2610.02022)系统检验了用 LLM 评判研究想法新颖性的可靠性。
- 背景:自动化科研系统的产出常由 LLM 评判新颖性,但这些 judge 很少被验证,且验证对象是人工撰写的论文而非生成的想法
- 作者从 OpenReview 自动构建评测集:挖掘审稿人明确肯定或质疑论文原创性的段落,只保留一致同意的提交
- 系统考察各种评测设计选择,结论是:这些 judge 表现不佳,判定结果对设计选择高度敏感、不稳定
- 对 automated idea generation / AI scientist 类工作是一个重要警示:别把新颖性打分当可靠信号
- 作者来自 Allen Institute 等机构(Noy Sternlicht、Peter Jansen、Daniel S. Weld、Tom Hope 等)
所属事件:研究称 LLM 评判 AI 想法新颖度并不可靠(3 条相关)→
「研究」频道最新
- 中国电信&MemTensor 发布 HaluMem:首个操作级智能体记忆幻觉基准 — jiqizhixin · 2026-10-09
- BAAI 发布研究智能体 AREX:逐条核验答案,BrowseComp 达 82.5% — DeepLearningAI · 2026-10-09
- 为超级智能构建 RL 环境的方法论,新文详解设计思路 — JenniferHli · 2026-10-09
- 用真随机解反事实难题:量子随机数发生器可给 RL 提供探索 — jessi_cata · 2026-10-09
- OpenAI 定理发布撞车学者在研工作,结果更强但难以读懂 — guyvdb · 2026-10-09
- AI 生成的论文泛滥预印本平台,学者提议用决策语言模型过滤噪音 — lpachter · 2026-10-09