开源基准已被污染:模型会正则搜出「藏起来」的答案
a1zhang · x · 2026-09-23
a1zhang 吐槽开源基准测试的现状:很难分辨模型到底是「已知道答案」还是真的被某项能力卡住。例如在「新」的长上下文基准上测 RLM 时,有的模型会直接用正则表达式检索被 offload 的信息、把解法抓出来。
他引用 HarnessTax 论文的解读:在公开基准上,性能基本只由模型能力决定、与 harness 无关,但实践中不同 harness 的行为和偏好差异明显——说明公开基准已被能力「吞噬」。
他的结论:新基准总会迅速被污染,大家应该想出更好的开源基准托管/管理方式,才能真正衡量能力;但他也反对「测模型能否完成两天任务」这类方案,认为一定存在能让基准有效期至少撑过一年的更好办法。
「模型」频道最新
- 传 OpenAI 与 Anthropic 内部模型领先公开发布版约两个月 — haider1 · 2026-09-24
- AI 检测器争论:研究者称 Pangram 是唯一靠谱的那个 — paulnovosad · 2026-09-24
- MiniMax H3 配 Spectrum 每步多跑一遍,GPU 空转拖慢速度 — Glittering-Cold-2981 · 2026-09-24
- Opus 5.5 半小时生成带音乐的赛博朋克像素动画,单 HTML 文件完成 — itsmnjn · 2026-09-24
- OpenAI 帮助中心惊现神秘模型「Astra Minor」,页面随后删除 — koltregaskes · 2026-09-24
- Baseten 上线 Nemotron 3 Diarization:单卡支持 500 路实时分离流 — baseten · 2026-09-24