Decider 模型靠去因果掩码涨分,作者称非刷榜且私榜不崩

antoine_chaffin · x · 2026-10-07

antoinechaffin 介绍其 decider 模型近期收益主要来自几个合理的改进决策:解除 causal mask 限制、扩充训练数据(并感谢 tasksource 数据集贡献者)。

针对「刷榜」(benchmaxxing)质疑,作者给出反驳证据:在全新排行榜上仍保持 top-1,且公开与私榜(private split)之间差距很小——「有些模型在私榜上崩了,我们的纹丝不动」。

作者预告后续路线图:reranking 性能提升、PII 检测能力、更强的多模态能力。

所属事件:Decider 模型作者回应刷榜质疑:公开私榜差距极小(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →