SOOFI 被指评测泄漏与过度宣传

JJitsev · x · 2026-07-19

作者指出,SOOFI 在比较中存在明显的 **eval leakage**:其克隆版训练集已经见过大部分评测数据,甚至 GPQA 还包含了测试集,因此拿来宣称“frontier-level champion”并不成立。 随后他进一步批评 SOOFI 的报告叙事:一方面夸大“透明”和“主权”定位,另一方面又没有清楚说明是在 Nemotron-3-Nano/开放 Nemotron stack 上复现;同时还用自建的“capability index”来支撑对比结论,存在明显的包装问题。

所属事件:SOOFI 被批评测泄漏与主权包装(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →