SOOFI 德语基准提升也被指来自重复见过评测
JJitsev · x · 2026-07-26
作者说,德文评测也呈现同样的问题:
- SOOFI 训练时看过所有德文改写评测,甚至重复了 10 次。
- Nemotron 3 Nano 没见过这些评测。
- 因而 SOOFI 只是在自己训练过的德国 benchmark 上占优,而在 HumanEval-DE 上又输给 Nemotron,进一步说明对比被污染扭曲了。
所属事件:SOOFI 模型被指评测数据严重泄漏,对比 Nemotron 失去公平性(9 条相关)→
「模型」频道最新
- 有人注意到 Opus-5 的词汇选择很特别 — adonis_singh · 2026-07-26
- Google 的 Gemma 团队公开征集下一代能力需求 — osanseviero · 2026-07-26
- 阿里用 Qwen3.8 反击,Kimi K3 让中美模型差距继续收窄 — emmanuelvivier · 2026-07-26
- Moonshot 发布开权重 Kimi K3,称多项测试逼近美国顶级模型 — emmanuelvivier · 2026-07-26
- 硅谷分歧加剧:中国开源权重模型已逼近美国顶级系统 — emmanuelvivier · 2026-07-26
- Kimi-K3 宣称在 IMO 2026 Lean 4 证明拿下 6/6 — songhan_mit · 2026-07-26