LLM 当评测员太乐观:OntBench 打分与人工评分严重背离

amplifiedamp · x · 2026-09-18

作者尝试用 Jev 作为 scorer 给 OntBench(考察各 LLM 制作本体映射能力的 benchmark)打分,发现完全不可用:它几乎给所有结果打高分,既不符合作者的人工评分,也与 Codex 的评分相悖(所有 scorer 均为盲评)。作者贴出了自己的 prompt 请教是否用法有误,并认为 Jev 现在与 Codex 表现接近,但仍然对一切过于乐观。

所属事件:Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →