用 Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖

amplifiedamp · x · 2026-09-18

开发者在 OntBench(评测各 LLM 制作本体映射能力的基准)中尝试用 Jev 作为打分器,结果发现完全不可用:它给几乎所有输出都打很高分,既不符合人工评分,也和 Codex 的打分结果不一致(所有打分器均盲测)。\n\n作者贴出了完整的打分 prompt(包括 evidence 边界说明和五档评分标准),向社区求问是否 prompt 写法有问题。

所属事件:Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →