用 bootstrap 子集拟合性能锥,Ville 不等式检验模型排名交叉

PTenigma · x · 2026-09-21

PTenigma 在讨论模型排行榜/挑战赛可靠性时提出一个方法建议:让参赛者在训练数据的 bootstrap 子集上训练模型,再拟合「性能锥」(performance cone),即可检测模型之间是否存在排名交叉(crossover)。

他给出的具体思路:

他担心目前很多排行榜/挑战赛不做这类统计处理,得出的排名未必可靠。整体是一个关于模型评测统计方法论的有实质内容的观点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →