SOOFI 自己的表格显示,去掉训练过的评测后分数下滑
JJitsev · x · 2026-07-26
作者直接拿报告里的 Table 5 说明,SOOFI 把一部分评测集拿去训练后,比较结果就被“带偏”了:
- MBPP 进入了 SOOFI 的训练集,但 LBPP 和 HumanEval 没有。
- 对那些没训练过的评测,SOOFI 分数明显更低,而 Nemotron 3 Nano 反而更高。
- 这条还列出了 SOOFI 见过的评测与 Nemotron 的训练数据,核心结论是:这场对比并不干净。
所属事件:SOOFI 模型被指评测数据严重泄漏,对比 Nemotron 失去公平性(9 条相关)→
「模型」频道最新
- 有人注意到 Opus-5 的词汇选择很特别 — adonis_singh · 2026-07-26
- Google 的 Gemma 团队公开征集下一代能力需求 — osanseviero · 2026-07-26
- 阿里用 Qwen3.8 反击,Kimi K3 让中美模型差距继续收窄 — emmanuelvivier · 2026-07-26
- Moonshot 发布开权重 Kimi K3,称多项测试逼近美国顶级模型 — emmanuelvivier · 2026-07-26
- 硅谷分歧加剧:中国开源权重模型已逼近美国顶级系统 — emmanuelvivier · 2026-07-26
- Kimi-K3 宣称在 IMO 2026 Lean 4 证明拿下 6/6 — songhan_mit · 2026-07-26