小米 MiMo 完成 RL 训练,DeepSWE 跃升至 72.57
小米 MiMo 模型的强化学习训练已完成,MiMo Pro 在 DeepSWE 基准上的成绩从 58.41 跃升至 72.57,接近当前最高分 74(由 A 开头模型保持)。随后 nrehiew 发布了对最新开源模型 MiMo-V2.6 的论文解读,该项目以公开直播 RL 训练过程为特色,其侧重与 DeepSeek v4.1 Flash 有所不同。
2026-09-21 ~ 2026-09-23 · 2 条相关
- 第 1 集:小米 MiMo 完成 RL 训练,DeepSWE 跃升至 72.57(2026-09-21,2 条)
- 第 2 集:小米开源 MiMo-V2.6 登顶开源权重榜,RL 训练全程直播(2026-09-22,39 条)
- 第 3 集:小米 MiMo-V2.6 Pro 实测:编码 3D 游戏多模态全面升级(2026-09-22,2 条)
- 小米 MiMo 完成 RL 训练,DeepSWE 从 58.41 跃至 72.57 — nrehiew_ · 2026-09-21
- 小米 MiMo-V2.6 公开 RL 训练:DeepSWE 从 58.4 冲至 72.57 — teortaxesTex · 2026-09-23