去污染报告救不了基准测试:评测者必须掌控测试集并复现结果

NoahPersaud · reddit · 2026-09-20

一位评测从业者论证:为什么实验室自证「训练数据里没有污染」注定无效,以及评测应该怎么做。

背景:今年 2 月 OpenAI 停报 SWE-bench Verified 并建议其他实验室跟进——他们测试的每个前沿模型都能复现人工参考修复或题面原文细节,六个月仅涨 6 分,剩余分数里有多少是真实能力已说不清。建基准的实验室自己把它退役了。

去污染报告为何无效,三个不可回避的原因:

承诺书和隐私集合求交(PSI)证明的只是实验室「申报的语料」,不是实际训练内容;已有的 proof-of-training 方案也被证明可伪造。

作者的方案:把控制权交给评测者——提交方拿不到标签、断网评测、评测者从指定 commit 自行构建并复现分数、测试数据尽量在提交冻结后生成,只有能被复现的结果才算数。他已做了一个小型版本(表格模型、私有测试集、出资方出题设门槛),并坦承未解决的缺口:无法证明基准本身质量、隐藏测试集可能被反复提交挤破、出资方可能泄题。

全文:reproduce-it-or-it-doesnt-count

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →