LLM 当评测员太乐观:OntBench 打分与人工评分严重背离
amplifiedamp · x · 2026-09-18
作者尝试用 Jev 作为 scorer 给 OntBench(考察各 LLM 制作本体映射能力的 benchmark)打分,发现完全不可用:它几乎给所有结果打高分,既不符合作者的人工评分,也与 Codex 的评分相悖(所有 scorer 均为盲评)。作者贴出了自己的 prompt 请教是否用法有误,并认为 Jev 现在与 Codex 表现接近,但仍然对一切过于乐观。
所属事件:Jev 当 LLM 评委翻车:几乎全打高分且与人工评分相悖(3 条相关)→
「模型」频道最新
- 前 ChatGPT 联合发明者发布 Jev:宣称快 200 倍、便宜 400 倍 — iamrobotbear · 2026-09-18
- Pro 用户控诉 Codex 用量骤降:加倍付费仍撑不住一天工作 — Junra · 2026-09-18
- GPT-6 Astra 破译一封此前无人解开的 1918 年德军无线电报 — moultano · 2026-09-18
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 — SakanaAILabs · 2026-09-18
- Gemini 3.8 Live 架构拆解:原生音频 Sub-100ms 延迟与实时工具调用 — 4bTechDecode · 2026-09-18
- Anthropic 开放生命科学验证计划,首次向生物学家放开 Mythos 模型 — EricBuess · 2026-09-18