研究称 LLM 裁判评想法新颖度并不可靠
Allen AI(AI2)团队发布研究,检验用 LLM 裁判评判「AI 科学家」所提想法新颖度的可靠性,结论是不可尽信。当前构建 AI scientist 系统时普遍依赖 LLM 打分来评估想法的新颖程度,但实验显示,提示词的微小改动就会让判定结果发生剧烈变化,甚至完全翻盘,这意味着此类自动化评估的结论需谨慎对待。
2026-10-09 ~ 2026-10-09 · 2 条相关
- 研究:用 LLM 当裁判评「想法新颖度」并不可靠 — MarioKrenn6240 · 2026-10-09
- 研究:LLM 评审判「AI 想法新颖度」,微小提示改动即可翻盘 — TuhinChakr · 2026-10-09