NeurIPS 评审已开始要求 21B 开源 MoE 模型评测
chhaviyadav_ · x · 2026-07-25
这条帖子的重点是:开源模型评测的门槛正在上移。
- 作者表示,评审们已经不再满足于 8B 级别模型。
- 在 NeurIPS 的语境下,大家开始要求对更大、更复杂的开源模型做评测,比如有人已经在问 GPT-OSS 这类 21B MoE 模型的结果。
- 这也意味着,单纯“能跑”已经不够了;对于这类模型,评测往往还需要进一步微调后再看表现。
整体反映的是研究评审和开源模型竞争进入更高规格阶段。
所属事件:NeurIPS评审提高开源模型评测门槛(2 条相关)→
「模型」频道最新
- 有人直言 Gemini 3.5 Pro 已经太晚难竞争 — teortaxesTex · 2026-07-25
- Anthropic 称 Claude Opus 5 以半价逼近前沿模型 — eyishazyer · 2026-07-25
- AutomationBench 图表显示 Opus 5 更强于长程智能体任务 — daniel_mac8 · 2026-07-25
- Claude Opus 5 进入 GitHub Copilot 和 Microsoft Foundry — DanWahlin · 2026-07-25
- CursorBench 3.2 显示 Claude Opus 5 仅落后 Fable 5 0.5 分,成本减半 — EricBuess · 2026-07-25
- Hyperagent:Opus 5 更强,但 GPT-5.6 Sol 更便宜更好落地 — TawohAwa · 2026-07-25