Jev 当 LLM 评分器翻车:几乎全给高分,与人工和 Codex 评分相悖
amplifiedamp · x · 2026-09-18
作者在 OntBench(测试各 LLM 做本体映射能力的 benchmark)里尝试用 Jev 作为自动评分器,结果完全不可用:它对几乎所有输出都打高分,既与作者的人工评分不符,也与 Codex 的评分相矛盾。
作者贴出了完整的评分 prompt(五档评分标准,从"多处重大错误"到"有明确边界支持的结论"),想请社区指出问题所在。这是 LLM-as-judge 的典型失败案例:评分器缺乏区分度,倾向于给正向评价。
所属事件:Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖(3 条相关)→
「模型」频道最新
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18
- GPT-6 Astra 破译一封此前无人解开的 1918 年德军无线电报 — moultano · 2026-09-18
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 — SakanaAILabs · 2026-09-18
- Gemini 3.8 Live 架构拆解:原生音频 Sub-100ms 延迟与实时工具调用 — 4bTechDecode · 2026-09-18
- Anthropic 开放生命科学验证计划,首次向生物学家放开 Mythos 模型 — EricBuess · 2026-09-18