Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖
开发者在 OntBench(评测各 LLM 制作本体映射能力的基准)中尝试用 Jev 作为自动评分器,结果发现完全不可用:它给几乎所有输出都打很高分,既与作者的人工评分不符,也与 Codex 的评分结果相悖。该案例显示过于乐观的 LLM 评委在基准评测中可能与人工判断严重背离。
2026-09-18 ~ 2026-09-18 · 3 条相关
- Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖 — amplifiedamp · 2026-09-18
- 用 Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖 — amplifiedamp · 2026-09-18
- LLM 当评测员太乐观:OntBench 打分与人工评分严重背离 — amplifiedamp · 2026-09-18