SOOFI 被指基准泄漏
JJitsev · x · 2026-07-19
SOOFI 被指在基准评测中存在 **eval leakage**:报告里使用了训练阶段已见过的重写版评测集,甚至可能包含测试集,导致其宣称的“frontier-level champion”缺乏说服力。 作者指出,如果改看报告中未被训练集覆盖的 **LBPP**,结果会更能说明问题:**Nemotron 3 Nano 38.1 分,对 Soofi 的 31.0 分**,显示未泄漏条件下原版模型明显更强。
所属事件:SOOFI 被批评测泄漏与主权包装(11 条相关)→
「模型」频道最新
- 韩国初创模型在 AAII 得 44 分,接近 DeepSeek V4 Pro — JungWooHa2 · 2026-07-21
- 有人预测 OpenAI 的 GPT-6 会比 Fable 高效得多 — bindureddy · 2026-07-21
- Moonshot 重点推出 Kimi K3 与 API 平台 — pstAsiatech · 2026-07-21
- Motif 3 Beta 上线 Hugging Face,韩国基础模型竞赛继续升温 — Secure_Smoke_4280 · 2026-07-21
- Sakana AI 的 Fugu-Cyber 更新在安全基准上领跑 — SakanaAILabs · 2026-07-21
- Mythos 发布被类比 o1:限量放出后又被开源复现 — nptacek · 2026-07-21