研究称 LLM 裁判评想法新颖度并不可靠

Allen AI(AI2)团队发布研究,检验用 LLM 裁判评判「AI 科学家」所提想法新颖度的可靠性,结论是不可尽信。当前构建 AI scientist 系统时普遍依赖 LLM 打分来评估想法的新颖程度,但实验显示,提示词的微小改动就会让判定结果发生剧烈变化,甚至完全翻盘,这意味着此类自动化评估的结论需谨慎对待。

2026-10-09 ~ 2026-10-09 · 2 条相关