Decider 模型作者回应刷榜质疑:公私榜差距极小
antoinechaffin 的 decider 模型近期成绩提升引发刷榜(benchmaxxing)质疑,其回应称收益主要来自合理的改进决策,包括解除 causal mask 限制、扩充训练数据(并感谢 tasksource 数据集)。为证明成绩真实,他强调模型在全新发布的排行榜上保持 top-1,且公开榜与私榜(private split)之间的差距极小,说明结果具备真实泛化能力,并非针对榜单优化。其回应获得网友点赞,称其为「榜单高分与科学标准双守门人」。
2026-10-07 ~ 2026-10-07 · 3 条相关
- 公开榜与私榜差距极小,作者以此证明模型未刷榜 — antoine_chaffin · 2026-10-07
- Decider 模型靠去因果掩码涨分,作者称非刷榜且私榜不崩 — antoine_chaffin · 2026-10-07
- 厂商回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing — antoine_chaffin · 2026-10-07