去污染报告救不了基准测试:评测者必须掌控测试集并复现结果
NoahPersaud · reddit · 2026-09-20
一位评测从业者论证:为什么实验室自证「训练数据里没有污染」注定无效,以及评测应该怎么做。
背景:今年 2 月 OpenAI 停报 SWE-bench Verified 并建议其他实验室跟进——他们测试的每个前沿模型都能复现人工参考修复或题面原文细节,六个月仅涨 6 分,剩余分数里有多少是真实能力已说不清。建基准的实验室自己把它退役了。
去污染报告为何无效,三个不可回避的原因:
- 实验室自查自证:训练语料在外看不到,没人能复跑搜索。
- 语料无法公开:等于公布所有受版权作品清单,是诉讼风险。
- 字面匹配漏掉大部分:改写、论坛攻略、GitHub 上的解法、由基准衍生的合成数据,都能让模型学会答案而不共享任何 n-gram。
承诺书和隐私集合求交(PSI)证明的只是实验室「申报的语料」,不是实际训练内容;已有的 proof-of-training 方案也被证明可伪造。
作者的方案:把控制权交给评测者——提交方拿不到标签、断网评测、评测者从指定 commit 自行构建并复现分数、测试数据尽量在提交冻结后生成,只有能被复现的结果才算数。他已做了一个小型版本(表格模型、私有测试集、出资方出题设门槛),并坦承未解决的缺口:无法证明基准本身质量、隐藏测试集可能被反复提交挤破、出资方可能泄题。
全文:reproduce-it-or-it-doesnt-count
「研究」频道最新
- SoL-Pi 论文:自动研究循环优化 Agent 框架,省近半 token 成本 — burny_tech · 2026-09-20
- LangChain 提出 Jev-as-a-Judge:廉价快速的语义验证器替代 LLM 评审 — multiply_matrix · 2026-09-20
- Spotify 提出代理网络时代的推荐系统新框架 — _reachsumit · 2026-09-20
- 微软研究员提醒:BERT 在 2019 年就被称为 LLM — JFPuget · 2026-09-20
- OpenAI 称解出 Navier-Stokes,被质疑「偷用」数学家的 Codex 会话成果 — ExamImmediate8956 · 2026-09-20
- AI 加速科学发现了吗?网络攻击激增、数学微增、算法无明显变化 — soumitrashukla9 · 2026-09-20