开源基准已被污染:模型会正则搜出「藏起来」的答案

a1zhang · x · 2026-09-23

a1zhang 吐槽开源基准测试的现状:很难分辨模型到底是「已知道答案」还是真的被某项能力卡住。例如在「新」的长上下文基准上测 RLM 时,有的模型会直接用正则表达式检索被 offload 的信息、把解法抓出来。

他引用 HarnessTax 论文的解读:在公开基准上,性能基本只由模型能力决定、与 harness 无关,但实践中不同 harness 的行为和偏好差异明显——说明公开基准已被能力「吞噬」。

他的结论:新基准总会迅速被污染,大家应该想出更好的开源基准托管/管理方式,才能真正衡量能力;但他也反对「测模型能否完成两天任务」这类方案,认为一定存在能让基准有效期至少撑过一年的更好办法。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →