用 Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖
amplifiedamp · x · 2026-09-18
开发者在 OntBench(评测各 LLM 制作本体映射能力的基准)中尝试用 Jev 作为打分器,结果发现完全不可用:它给几乎所有输出都打很高分,既不符合人工评分,也和 Codex 的打分结果不一致(所有打分器均盲测)。\n\n作者贴出了完整的打分 prompt(包括 evidence 边界说明和五档评分标准),向社区求问是否 prompt 写法有问题。
所属事件:Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖(3 条相关)→
「模型」频道最新
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18
- GPT-6 Astra 破译一封此前无人解开的 1918 年德军无线电报 — moultano · 2026-09-18
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 — SakanaAILabs · 2026-09-18
- Gemini 3.8 Live 架构拆解:原生音频 Sub-100ms 延迟与实时工具调用 — 4bTechDecode · 2026-09-18
- Anthropic 开放生命科学验证计划,首次向生物学家放开 Mythos 模型 — EricBuess · 2026-09-18