博主想拿 Clef 当 LLM 评委,结果发现大量坏掉的评分规则

xeophon · x · 2026-10-09

博主 xeophon 原本想用 Clef 做 LLM-as-judge 的基准测试,却在过程中发现了大量损坏的评分规则(rubrics),并附了截图。这一发现提示:评测工具本身的规则质量不可靠,用 AI 评委打分前得先审查 rubric 的有效性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →