小米 MiMo-V2.6-Pro 冲进 Code Arena 前十,开源模型排第三
arena · x · 2026-09-22
小米新模型 MiMo-V2.6-Pro 登陆 WebDev Code Arena,AutoEval 首秀即以 1628 分进入总榜约第 10 名,在开源权重模型(MIT 许可)中约排第 3。
- 得分与 Claude Fable 5 (High) 持平,略超 Hy4-preview(1624 分);较上一代 MiMo-V2.5-Pro 的 1475 分大涨 153 分。
- 开源榜上距第 2 名 Qwen3.8 Flash Next 仅差 7 分,距榜首 Kimi K3 Max 差 46 分。
- 注意:目前为 AutoEval 早期分数(基于 Arena 人类偏好数据训练的奖励模型自动投票),后续人类实时投票会让分数收敛。
「模型」频道最新
- DFlash2 搭配 GLM 5.3 Flash 处理超长 prompt 会出问题 — TheZachMueller · 2026-09-22
- 「MiMo 首创大规模 MOPD」:圈内热议 MiMo-V2.6 向 DeepSeek 叫板 — teortaxesTex · 2026-09-22
- 数字母测试翻车不冤:Jev 逐字母输入 strawberry 时 168/168 全对 — BLUECOW009 · 2026-09-22
- 博主自纠:落地 SF 发现真正惊喜是 MiMo-2.6,胜过 Grok 4.7 且更便宜 — kimmonismus · 2026-09-22
- DataBench 新图表流出,疑似 OpenAI 内部模型 luna 曝光 — almmaasoglu · 2026-09-22
- Mimo 2.6 Pro 实测:需更多引导,调教后接近顶尖水平 — power97992 · 2026-09-22