Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖

amplifiedamp · x · 2026-09-18

作者在 OntBench(测试各 LLM 做本体映射能力的 benchmark)里尝试用 Jev 作为自动评分器,结果完全不可用:它对几乎所有输出都打高分,既与作者的人工评分不符,也与 Codex 的评分相矛盾。

作者贴出了完整的评分 prompt(五档评分标准,从"多处重大错误"到"有明确边界支持的结论"),想请社区指出问题所在。这是 LLM-as-judge 的典型失败案例:评分器缺乏区分度,倾向于给正向评价。

所属事件:Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →