arXiv 论文:追踪多准则最佳模型所需数据量随准则数指数增长
sanmikoyejo · x · 2026-10-01
斯坦福 Allouah 与 Duchi 的 arXiv 论文《How Reusable Are Benchmarks with Richer Feedback?》为前述实证攻击提供理论支撑。
- 研究在开发者依据多准则评测反馈自适应选模型的场景下,形式化分析基准的可复用性。
- 结论:在固定精度与置信度下,要在 k 个评测准则的任意凸组合下估计最佳分数,最坏情况所需测试集规模随 k 指数增长;O(log k) 个准则的成本就相当于回答 k 个自适应统计查询的 Θ(√k) 代价。
- 在 5-10 个准则的多任务 LLM 基准上做攻击验证:仅返回非支配任务画像的反馈也会产生大的复用-留出分数差距与频繁的"假冠军"。
- 结果挑战了"基准可重复使用是因为开发者只在真正超越当前最优时才响应"这一解释,但仍留下普通模型开发多大程度会遇到此漏洞的开放问题。
「研究」频道最新
- Fortnow 谈学编程能否帮你理解计算复杂性 — fortnow · 2026-10-01
- Grokking 不是魔法:权重衰减压缩空间振荡才是泛化关键 — burny_tech · 2026-10-01
- 数学家 Buckmaster 受访回应 AI 解 Navier-Stokes 疑窃取其成果争议 — burny_tech · 2026-10-01
- 用 Reddit 真实提问测 LLM:能否守住「不可上传数据」这类硬约束 — investigatormaker · 2026-10-01
- Isomorphic Labs 药物设计 Agent 自主运行数天,分子设计从数月缩至数日 — burny_tech · 2026-10-01
- 17岁少年用计算机辅助证明分类全部 noble 多面体,夺25万美元大奖 — burny_tech · 2026-10-01