研究:LLM 评审判「AI 想法新颖度」,微小提示改动即可翻盘

TuhinChakr · x · 2026-10-09

Allen AI(AI2)团队研究用 LLM judge 评判「AI 科学家」想法新颖度的可靠性,结论是不可太信。

要点:

对这类评测场景需要更稳健的评估方法。

所属事件:研究称 LLM 裁判评想法新颖度并不可靠(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →