小米 MiMo 完成 RL 训练,DeepSWE 跃升至 72.57

小米 MiMo 模型的强化学习训练已完成,MiMo Pro 在 DeepSWE 基准上的成绩从 58.41 跃升至 72.57,接近当前最高分 74(由 A 开头模型保持)。随后 nrehiew 发布了对最新开源模型 MiMo-V2.6 的论文解读,该项目以公开直播 RL 训练过程为特色,其侧重与 DeepSeek v4.1 Flash 有所不同。

2026-09-21 ~ 2026-09-23 · 2 条相关

事件全程(共 3 集)→