只看 pass/fail 分数已无法解读评测:隐藏测试过严致大量误判

trq212 · x · 2026-09-12

作者指出,如今仅凭 benchmark 的 pass/fail 分数已很难解读模型真实能力:他观察到的许多「失败」案例其实源于过于严苛的隐藏测试,有些情况下模型的答案比评测的标准答案更合理。这提示当前 eval 的标注质量与判定规则正在成为噪声来源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →