从业者:隐藏测试过严致误判,pass/fail 分数已难解读评测
有从业者撰文指出,如今仅凭 benchmark 的 pass/fail 分数已几乎无法解读模型的真实能力:他观察到的许多「失败」案例其实源于评测中过于严苛的隐藏测试,有些情况下模型的回答甚至比标准答案更合理。这一观察引发共鸣,呼吁对评测结果进行更细致的人工审查,而非迷信单一分数。
2026-09-12 ~ 2026-09-12 · 2 条相关
- 只看 pass/fail 分数已无法解读评测:隐藏测试过严致大量误判 — trq212 · 2026-09-12
另有 1 条近重复转述:himanshustwts