SOOFI 被指基准泄漏

JJitsev · x · 2026-07-19

SOOFI 被指在基准评测中存在 eval leakage:报告里使用了训练阶段已见过的重写版评测集,甚至可能包含测试集,导致其宣称的“frontier-level champion”缺乏说服力。

作者指出,如果改看报告中未被训练集覆盖的 LBPP,结果会更能说明问题:Nemotron 3 Nano 38.1 分,对 Soofi 的 31.0 分,显示未泄漏条件下原版模型明显更强。

所属事件:欧洲开源模型 SOOFI 被指评测泄漏与过度包装(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →