厂商回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing

antoine_chaffin · x · 2026-10-07

antoinechaffin(被转发点赞为「榜单高分与科学标准双守门人」)回应 benchmaxxing 质疑:其模型在新发布的全新排行榜上保持 top-1,且公私有划分之间的差距很小——「有些模型在私有集上崩了,我们的没有」。他以公开/私有集表现差作为模型增强并非针对榜单过拟合的证据。原帖未指明具体模型与榜单细节。

所属事件:Decider 模型作者回应刷榜质疑:公私榜差距极小(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →