修一个 grader 评测分数翻倍,AI 评测质量再遭吐槽
AI 社区再掀对评测基准可靠性的吐槽。用户 Xeophon 自曝:仅靠修复一个写得很简单的 grader(评分器),模型评测分数就翻了一倍,且剩下的 20% 分差竟来自任务本身的错误。他还转发旧帖嘲讽所谓「hard」高难度评测屡屡被扎实的基础能力轻松击败,问题出在出题方而非模型极限。多帖共同指向 LLM 评测中 grader 与任务质量低劣、分数失真的普遍现象。
2026-09-17 ~ 2026-09-17 · 3 条相关
- 又见「难题」被吊打:Xeophon 嘲讽评测榜常年翻车 — xeophon · 2026-09-17
- 修好一个简单的 grader,评测分数直接翻倍 — xeophon · 2026-09-17
- 修个 grader 分数翻倍,剩下 20% 竟是任务本身的错误 — xeophon · 2026-09-17