修一个 grader 评测分数翻倍,AI 评测质量再遭吐槽

AI 社区再掀对评测基准可靠性的吐槽。用户 Xeophon 自曝:仅靠修复一个写得很简单的 grader(评分器),模型评测分数就翻了一倍,且剩下的 20% 分差竟来自任务本身的错误。他还转发旧帖嘲讽所谓「hard」高难度评测屡屡被扎实的基础能力轻松击败,问题出在出题方而非模型极限。多帖共同指向 LLM 评测中 grader 与任务质量低劣、分数失真的普遍现象。

2026-09-17 ~ 2026-09-17 · 3 条相关