研究:用 LLM 当裁判评「想法新颖度」并不可靠

MarioKrenn6240 · x · 2026-10-09

一条被转发的推文指出:如今评估 AI 科学家提出的想法有多新颖,通常交给 LLM 裁判来打分。作者团队测试了这些裁判的可信度,结论是「不太可信」——提示词的微小改动就会让判定结果剧烈摆动,有时甚至低于抛硬币的准确率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →