研究者指控SOOFI模型评测作弊
JJitsev · x · 2026-07-15
AI 研究者 Janus Leufer(@JJitsev)指出,新发布的 SOOFI 模型在宣称与 NVIDIA 的 Nemotron-3-Nano 性能相当甚至更好时,涉嫌操纵基准测试数据。
对比数据显示,SOOFI 报告中引用的 Nemotron-3-Nano 成绩被大幅压低(例如 MMLU-Pro 报告为 51.6,而 NVIDIA 官方原版为 65.05)。这种通过故意降低参考模型分数来衬托自身模型表现的“刷榜”手法,在 AI 圈引发了关于评测公正性的讨论。
所属事件:SOOFI 评测泄漏与基线对比争议(13 条相关)→
「模型」频道最新
- 网友热议 DeepSeek 新模型:K3 还是缩水版 K3-Flash? — teortaxesTex · 2026-09-11
- DeepSeek 新版多轮改 System Prompt 不再击穿缓存,费用省 36.6% — teortaxesTex · 2026-09-11
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11