研究者指控SOOFI模型评测作弊

JJitsev · x · 2026-07-15

AI 研究者 Janus Leufer(@JJitsev)指出,新发布的 SOOFI 模型在宣称与 NVIDIA 的 Nemotron-3-Nano 性能相当甚至更好时,涉嫌操纵基准测试数据。

对比数据显示,SOOFI 报告中引用的 Nemotron-3-Nano 成绩被大幅压低(例如 MMLU-Pro 报告为 51.6,而 NVIDIA 官方原版为 65.05)。这种通过故意降低参考模型分数来衬托自身模型表现的“刷榜”手法,在 AI 圈引发了关于评测公正性的讨论。

所属事件:SOOFI 评测泄漏与基线对比争议(13 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →