SOOFI 评测泄漏与基线对比争议

7 月 15 日至 16 日,围绕 SOOFI 模型评测与宣传方式的质疑集中出现。Janus Leufer(@JJitsev)认为,SOOFI 宣称可匹配或超过 NVIDIA 的 Nemotron-3-Nano、甚至自称“最强开源模型”,所依据的对比既可能受“重写评测集”泄漏污染,也可能因基线分数呈现方式而失真。这场争议之所以受关注,在于它直指开源模型发布最敏感的信任问题:训练数据是否与测试集重叠,基线模型是否被公平比较。

关键质疑

按 @JJitsev 的说法,SOOFI 使用的数据集中含有重写后的评测集,包括 GPQA Diamond 和部分德语评测。他还区分了 Nemotron 的不同版本:原始 Nemotron 3 Nano 没有用这些重写评测训练,而 Nemotron 3 Super 使用了它们,因此拿 SOOFI 与 Nemotron-3-Nano 直接比强弱,会把训练污染带来的优势混入模型能力本身。@teortaxesTex 也借 GPQA 提醒,即便只是轻度改写,只要进入训练,仍可能严重污染评测;他举到的现象甚至涉及对这类数据训练 10 个 epoch。

哪些对比更有参考价值

@JJitsev 特别提到,SOOFI 报告表 5 中的 LBPP 不在这批重写评测集之内,因此更适合作为参照。按他的转述,Nemotron 3 Nano 在这一基准上明显优于 SOOFI。对于德语能力宣传,他同样认为证据不足:SOOFI 本就拥有更多德语训练数据,如果又把重写后的德语评测纳入训练,那么“德语更强”的结论会进一步失真。

分数呈现与外溢争议

除了数据污染,@JJitsev 还质疑 SOOFI 报告给出的 Nemotron-3-Nano 分数低于 NVIDIA 官方公开结果,从而让 SOOFI S 更像“前沿冠军级”模型。基于这些问题,他认为目前没有证据表明 SOOFI 已能匹配其来源模型 Nemotron 3,并呼吁停止过度宣称,以免伤害开源发布的可信度。另有 @eliebakouch 进一步质疑其“主权”定位,称该模型与 Nemotron-3-Nano 架构接近,约 80% 的数据混合也相同,同时同样指向 GPQA Diamond 等评测集污染问题。

2026-07-15 ~ 2026-07-16 · 13 条相关

一手来源

另有 1 条近重复转述:JJitsev