SOOFI 模型被指评测数据严重泄漏,对比 Nemotron 失去公平性

SOOFI 模型报告被指存在严重的评测数据泄漏问题。作者 @JJitsev 通过多篇分析指出,SOOFI 在与 Nemotron 3 Nano 的对比中使用了不公平的受污染数据,导致结论误导公众。在剔除被污染的评测基准后,SOOFI 的实际表现并不及报告所呈现的水平。

已确认

根据 @JJitsev 的分析,以下事实可直接从 SOOFI 的报告及数据中核实:

- **训练集包含评测数据**:SOOFI 的训练集包含了多项后来用于对比的评测基准,例如 MBPP 进入了训练集,而 LBPP 和 HumanEval 则没有。报告自带的 Table 5 显示,去掉训练过的评测后,SOOFI 的分数出现了明显下滑。

- **德语评测重复训练**:SOOFI 在训练时看过了所有德文改写评测,甚至重复了 10 次,而作为对比对象的 Nemotron 3 Nano 并未见过这些评测数据。

- **部分泄漏点被修补**:在更新版的 SOOFI-S 报告中,开发团队删除了 GPQA,并放弃了上版报告中的 capability index。这一改动导致 SOOFI-S 的分数下降,大致回落到与 Nemotron 3 Nano 相当的水平。

尚未确认

- 报告将 Nemotron 3 Nano 标记为“open-weights”,@JJitsev 认为其数据和训练栈本来就是开放的,并质疑 SOOFI 报告在开源性和透明度上存在夸大和误导,这一主观评价尚存争议。

为什么重要

大模型评测的公正性是研究社区的基石。如果模型在训练阶段就已经“见过答案”,其评测分数将失去参考价值。@JJitsev 强调,SOOFI 的报告试图用边缘修补来转移注意力,而未彻底解决评测污染的核心问题,这不仅误导了公众对其真实能力的认知,也破坏了模型横向对比的公平性。

2026-07-26 ~ 2026-07-26 · 9 条相关

一手来源