用 bootstrap 子集拟合性能锥,Ville 不等式检验模型排名交叉
PTenigma · x · 2026-09-21
PTenigma 在讨论模型排行榜/挑战赛可靠性时提出一个方法建议:让参赛者在训练数据的 bootstrap 子集上训练模型,再拟合「性能锥」(performance cone),即可检测模型之间是否存在排名交叉(crossover)。
他给出的具体思路:
- 通过 bootstrap 多次抽样训练,观察模型排名随算力增长是否会交叉翻转,而不只看单点排名
- 引用 Ville 的置信序列(confidence sequences)作为收敛律,用于在最少的抽样次数下控制「漏掉一次交叉」的风险,降低算力开销
- 如果模型全部开源,还可以做配对数据的配对检验(paired tests),统计敏感度更高
他担心目前很多排行榜/挑战赛不做这类统计处理,得出的排名未必可靠。整体是一个关于模型评测统计方法论的有实质内容的观点。
「研究」频道最新
- GEPA 优化提示词,把 Jev 医学文献任务 F1 从 69.1% 提到 79.7% — matei_zaharia · 2026-09-21
- 把哲学体系变成可执行的 RL 目标,才是价值对齐的真问题 — willcb · 2026-09-21
- 图解循环结构:从 Amari-Hopfield 网络一直讲到 GPT-6 Astra — gklambauer · 2026-09-21
- Anthropic 在湾区建生物湿实验室,让 Claude 指挥机器人做药物研究 — FinanceYF5 · 2026-09-21
- DraftTrace:从过程而非结果评估学生 AI 时代学习 — keviv9 · 2026-09-21
- Matthew Berman 探讨:这只仿真果蝇到底算不算「真」 — Matthew Berman · 2026-09-21