LLM 评测陷阱:不要盲目信任作为裁判的模型

maylad31 · reddit · 2026-08-26

作者指出了使用 LLM 作为裁判 进行评测时的不稳定性:仅改变字段顺序就可能产生不同结果。建议在使用 LLM 打分时,必须进行一致性评估,优先使用定义明确的类别或清晰的评分标准,避免在简单提示下使用任意数值打分。作者强调不要盲目信任 LLM 裁判,并探讨了如何评估“评估者”本身的方法论。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →