公开榜与私榜差距极小,作者以此证明模型未刷榜

antoine_chaffin · x · 2026-10-07

antoinechaffin 回应「benchmaxxing」质疑:其模型不仅在新榜单上保持 top-1,公开与私榜(private split)的差距也非常小,说明成绩真实泛化而非针对公开测试集优化。他写道「有些模型在私榜上崩了,我们的纹丝不动」。

所属事件:Decider 模型作者回应刷榜质疑:公开私榜差距极小(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →