SOOFI 模型被指评测数据严重泄漏,对比 Nemotron 失去公平性
SOOFI 模型报告被指存在严重的评测数据泄漏问题。作者 @JJitsev 通过多篇分析指出,SOOFI 在与 Nemotron 3 Nano 的对比中使用了不公平的受污染数据,导致结论误导公众。在剔除被污染的评测基准后,SOOFI 的实际表现并不及报告所呈现的水平。
已确认
根据 @JJitsev 的分析,以下事实可直接从 SOOFI 的报告及数据中核实:
- **训练集包含评测数据**:SOOFI 的训练集包含了多项后来用于对比的评测基准,例如 MBPP 进入了训练集,而 LBPP 和 HumanEval 则没有。报告自带的 Table 5 显示,去掉训练过的评测后,SOOFI 的分数出现了明显下滑。
- **德语评测重复训练**:SOOFI 在训练时看过了所有德文改写评测,甚至重复了 10 次,而作为对比对象的 Nemotron 3 Nano 并未见过这些评测数据。
- **部分泄漏点被修补**:在更新版的 SOOFI-S 报告中,开发团队删除了 GPQA,并放弃了上版报告中的 capability index。这一改动导致 SOOFI-S 的分数下降,大致回落到与 Nemotron 3 Nano 相当的水平。
尚未确认
- 报告将 Nemotron 3 Nano 标记为“open-weights”,@JJitsev 认为其数据和训练栈本来就是开放的,并质疑 SOOFI 报告在开源性和透明度上存在夸大和误导,这一主观评价尚存争议。
为什么重要
大模型评测的公正性是研究社区的基石。如果模型在训练阶段就已经“见过答案”,其评测分数将失去参考价值。@JJitsev 强调,SOOFI 的报告试图用边缘修补来转移注意力,而未彻底解决评测污染的核心问题,这不仅误导了公众对其真实能力的认知,也破坏了模型横向对比的公平性。
2026-07-26 ~ 2026-07-26 · 9 条相关
一手来源
- SOOFI 自己的表格显示,去掉训练过的评测后分数下滑 — JJitsev ·
- SOOFI 德语基准提升也被指来自重复见过评测 — JJitsev ·
- SOOFI 虽移除 GPQA,和 Nemotron 的对比仍不干净 — JJitsev ·
- SOOFI 更新版仍未解决基准污染问题 — JJitsev · 2026-07-26
- 【源头】SOOFI 虽移除 GPQA,和 Nemotron 的对比仍不干净 — JJitsev · 2026-07-26
- SOOFI 被指见过多项拿来对比 Nemotron 的评测集 — JJitsev · 2026-07-26
- 【源头】SOOFI 自己的表格显示,去掉训练过的评测后分数下滑 — JJitsev · 2026-07-26
- 【源头】SOOFI 德语基准提升也被指来自重复见过评测 — JJitsev · 2026-07-26
- SOOFI 英德双语评分都被指存在基准泄漏 — JJitsev · 2026-07-26
- SOOFI 多训练 2T tokens 后,仍可能只是追平 Nemotron 3 Nano — JJitsev · 2026-07-26
- 质疑 SOOFI 报告夸大开源性,涉及 Nemotron 3 Nano 克隆 — JJitsev · 2026-07-26
- SOOFI 更新报告仍被指评测污染,Nemotron 3 Nano 可能还更强 — JJitsev · 2026-07-26