只看 pass/fail 分数已无法解读评测:过严的隐藏测试在制造假失败

xhluca · x · 2026-09-12

xhluca 指出,如今仅看 benchmark 的 pass/fail 分数已基本无法解读模型评测。他观察到许多 benchmark 失败案例源于过于严格的隐藏测试——有时模型的答案比评测预期的「标准答案」更合理。回复者补充:在非二元任务上,超过 95% 的高分此时反而可能是负信号。

所属事件:从业者:只看 pass/fail 分数已无法解读 AI 评测(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →