研究:LLM 评审判「AI 想法新颖度」,微小提示改动即可翻盘
TuhinChakr · x · 2026-10-09
Allen AI(AI2)团队研究用 LLM judge 评判「AI 科学家」想法新颖度的可靠性,结论是不可太信。
要点:
- 当前构建 AI scientist 系统时,常用 LLM 来判断其生成想法的新颖性
- 实测发现微小的 prompt 改动就会让评审结论剧烈摇摆,某些情况下低于抛硬币的稳定性
- 对做 AI scientist / 自动化科研的人来说,直接依赖 LLM judge 评 novelty 有很大风险
对这类评测场景需要更稳健的评估方法。
所属事件:研究称 LLM 裁判评想法新颖度并不可靠(2 条相关)→
「研究」频道最新
- aimotive 自动驾驶数据集训练标签靠「事后诸葛」追踪器生成 — RexDouglass · 2026-10-09
- Yale 研究发现 LLM 内部表征存在符号结构 — tallinzen · 2026-10-09
- COLM 2026 离散扩散 meetup:10 月 8 日 4-5 点 Grand Ballroom — yuntiandeng · 2026-10-09
- Astra 机器人控制实测:Johns Hopkins 深度评测其运动与控制理解 — jmin__cho · 2026-10-09
- Tavily 智能体可见性报告遭质疑:提问带域名才 93% 实时检索 — edwin · 2026-10-09
- 独立研究者发布 AI 加速相变模型,6 个预注册预测窗口全部命中 — sadeyeprophet · 2026-10-09