SOOFI 英德双语评分都被指存在基准泄漏
JJitsev · x · 2026-07-26
作者称,SOOFI 的英文和德文评测结果都被严重污染:
- SOOFI 训练时看过很多后来又拿来对比的 benchmark。
- 这让它与 Nemotron 的比较失去公平性,因为后者没见过这些评测。
- 他举例说:SOOFI 在自己训练过的指标上更高,但在 HumanEval-DE 这类未见过的评测上,Nemotron 反而领先。
所属事件:SOOFI 模型被指评测数据严重泄漏,对比 Nemotron 失去公平性(9 条相关)→
「模型」频道最新
- “5.6 Pro”被指在数学型任务上胜过 Fable 5 — MParakhin · 2026-07-26
- Claude 写 Opus 5 批评时总在替它辩护 — sethlazar · 2026-07-26
- Unsloth 的 Qwen3.6-35B-A3B GGUF 在 HF 走红 — unsloth · 2026-07-26
- SOOFI 多训练 2T tokens 后,仍可能只是追平 Nemotron 3 Nano — JJitsev · 2026-07-26
- 让 Claude 先追问澄清,能直接挖出遗漏前提 — Commercial-Most3081 · 2026-07-26
- 用户称 Claude Opus 5 比 GPT-5.6 Sol 更有常识感 — dejavucoder · 2026-07-26