斯坦福研究:仅需 2 次提交即可"刷"出排行榜虚假冠军
sanmikoyejo · x · 2026-10-01
斯坦福团队(Allouah、Duchi、Koyejo)发布新研究,揭示细粒度基准反馈如何被用来制造虚假的模型进步。
核心发现:
- HELM、LiveBench、Open LLM、SWE-bench、Terminal-Bench-Science 等榜单为开发者提供分维度分数,但这种"丰富反馈"每次提交都会泄露测试集信息。
- 攻击者只需少至 2 次模型提交,就能制造出一个榜单冠军,而其在未见数据上实际落后——排名进步是假的。
- 攻击改编自 Blum & Hardt (2015) 的 boosting 方法与 Feldman 等 (2019) 的反馈加权聚合,理论根基是 Dwork 等 (2015) 开创的自适应数据分析。
- 配套理论论文证明:在 k 个评测准则的任意凸组合下追踪最佳模型,所需测试集规模在最坏情况下随准则数量指数增长。
- 结论挑战了"基准可重复使用"的既有乐观判断,网站提供代码、理论论文与技术报告。
「研究」频道最新
- Fortnow 谈学编程能否帮你理解计算复杂性 — fortnow · 2026-10-01
- Grokking 不是魔法:权重衰减压缩空间振荡才是泛化关键 — burny_tech · 2026-10-01
- 数学家 Buckmaster 受访回应 AI 解 Navier-Stokes 疑窃取其成果争议 — burny_tech · 2026-10-01
- 用 Reddit 真实提问测 LLM:能否守住「不可上传数据」这类硬约束 — investigatormaker · 2026-10-01
- Isomorphic Labs 药物设计 Agent 自主运行数天,分子设计从数月缩至数日 — burny_tech · 2026-10-01
- 17岁少年用计算机辅助证明分类全部 noble 多面体,夺25万美元大奖 — burny_tech · 2026-10-01