MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
Xiaomi LLM-Core Team, :, Zongming Qiao, Ziyue Hua, Zirui Ou, Zihao Yue, Zihan Jiang, Zhuo Huang, Zhiyang Chen, Zhixian Zheng, Zhipeng Xu, Zhengrui Ma, Yuyang Hu, Yuhang Dong, Yuechen Zhang, Yudong Wang, Yuanxin Liu, Yixin Yang, Yishuo Cai, Yikai Zhao, Yihan Yan, Yifan Zhang, Yifan Song, Xiyu Wei, Xing Zhang, Xin Zhang, Xiaoqian Liu, Xiaodong Ji, Xiangwei Deng, Xueyu Guo, Wenhan Ma, Weimin Xiong, Weikun Wang, Weiji Zhuang, Shuo Liu, Shuhuai Ren, Shuhao Gu, Shimao Chen, Shijie Cao, Shihua Yu, Shicheng Li, Shengjie Zhou, Shaolei Zhang, Rang Li, Qiying Wang, Qingkai Fang, Qianli Chen, Minzheng Wang, Liwen Wang, Linli Yao, Linghao Zhang, Liangyu Cheng, Liang Zhao, Lei Li, Jinhao Dong, Jinyu Xiang, Jianyu Wei, Jiangshan Duo, Huaqiu Liu, Huanjie Fan, Hongyi Guan, Hongshen Xu, Hao Tian, Hanyu Li, Hailin Zhang, Gang Wang, Fuli Luo, Feng Wei, Dong Zhang, Dawei Zhu, Chiheng Lou, Chenhong He, Chenhao He, Chenghua Liu, Bowen Ye, Bowen Shen, Boshen Xu, Bo Yang, Bingquan Xia, Bangjun Xiao, Baixuan Xu, Zhouxiang Mao, Zhiyang Zhang, Zhixiang Xu, Zhenru Lin, Zhengju Tang, Zhaojun Huang, Yuzhe Weng, Yuxing Xiang, Yuxiao Li, Yuheng Yang, Yuhang Wang, Yuchen Liu, Yuanyuan Tian, Yuanliang Dong, Yu Cheng, Yongzhe He, Yongshun Liang, Yong Wang, Yiyan Wang, Yitian Gong, Yijie Zhang, Yanshu Xin, Xun Zhang, Xingjian Zhao, Wenyu Yang, Wenshan Huang, Wenhao Li, Tingwei Huang, Tianyu Yu, Tianyang Lu, Taoyu Yang, Sinan Du, Shutong Tian, Shulin Du, Shengfan Wang, Shanchuan Fang, Qihao Zhang, Qibin Yang, Qian Yu, Qian Tu, Pengrong Xie, Peipei Wang, Peidian Li, Minkun Guo, Mingchen Shao, Luohan Gao, Lijie Wang, Liang Shi, Kaiqi Chen, Kaiming Liu, Kaifei Wang, Kai Yang, Jinlong Xue, Jiechen Zhang, Jiaxuan Liu, Hongxu An, Hao Peng, Hanglong Lü, Guonan Wang, Feiyu Yang, Fanyu Cao, Fangyue Liu, Fan Cui, Cong Wang, Chun Chen, Chenxu Bai, Chengxuan Zhu, Chenghua Wang, Boyi Zeng
cs.CL
2026-10-08
小米花 260 万美元 agentic RL 把 1T MoE 的 DeepSWE 从 58.4 提到 72.6,逼近 Claude Opus 5;RL 环境与训练框架开源。
把 RL 推到长程 agent 任务上,卡点不在算法,在三件脏活:奖励信号太粗,测试通过就是 1,通过得干净还是侥幸看不出来;模型会钻奖励空子(reward hacking);MoE 路由器在大 batch RL 下会崩。小米的 MiMo-V2.6 报告把整个栈重做了一遍:Pro 是 1.02T 参数、42B 激活的 MoE,Flash 是 310B、15B 激活。上一代 MiMo-V2.5-Pro 在 DeepSWE 上只有 19.0 分,这代 Pro 到 71.9,离 Claude Opus 5 的 74.0 差 2.1 分。报告把目标挂在递归自我改进(RSI)这个愿景上,做法很实际:一次混合任务 RL run,把编码、通用、视觉、安全全放进同一个训练批次。
底座。骨干用滑窗注意力 SWA(每个 token 只看邻近 128 个 token)与全局注意力交替堆叠,配 681M 的 MiMo-ViT、音频编码器,加一个 DFlash 式 MTP 投机解码器,一次起草 7 个 token。Pro 预训练 30T token,Flash 48T。中训练换成 agent 数据混合,上下文从 256K 拉到 1M,隐藏权重的优化器从 AdamW 换成 Muon 变体 Muown:矩阵正交化更新在大 batch 区间数据效率更好,为后面的 RL 做铺垫,切换全程没有 loss spike。
RL 沿三个轴放大:
路由冻结是稳定性关键。router 可训练时,RL 前 20 步内某层的负载变异系数从 0.78 涨到 2.0,冷专家占比从 0.5% 涨到 22%;把第 20 步检查点的 router 参数单独恢复到 RL 前的值,负载复原且性能不变,崩的是 router 不是专家。RL 期间冻结 router,三项指标全程平稳。
RL 之后用 MOPD2 做多教师蒸馏,把能力补到难验证的领域,比如游戏开发、科研、具身智能。
RL 过程本身就是结果:DeepSWE v1.1(average@3)上,Pro 花 260 万美元从 58.4 涨到 72.6,Flash 花 90 万美元从 48.7 到 65.7。Pro 的开销拆分:rollout 43.8%、训练 43.5%、grader 12.7%。
| 基准 | MiMo-V2.6-Pro | MiMo-V2.5-Pro | Claude Opus 5 | GPT-5.6 Sol |
| DeepSWE v1.1 | 71.9 | 19.0 | 74.0 | 73.0 |
| AutomationBench v1.0.6 | 53.1 | 16.0 | 50.3 | 45.8 |
| CyberGym | 94.0 | 40.0 | 22.1 | 30.3 |
| MiMo Visual Coding | 72.3 | — | 70.0 | 73.4 |
| ProgramBench | 26.5 | 12.5 | 37.0 | 25.0 |
三组消融各回答一个工程问题。GAR 消融:去掉在线评分,turn 数和 token 长度暴涨,pass rate 涨不动,离线审计发现模型学会加投机兼容分支、吞异常这类能过测试但更难维护的写法;开着 GAR,涨势维持到第 52 步,turn 数基本平稳。多 harness 迁移:训练只见四个自建 mini-harness,三个没见过的 harness(claude code、codex、mini-swe-agent)平均 Pass@1 从约 50% 涨到 66%,学到的确实是解题能力而非 harness 肌肉记忆。防 hack 靠三层:环境构建时清理泄漏产物、hack agent 迭代挖洞再修补、训练中离线审计,确认 hack 的轨迹占比全程低于 2%。
失败分析写得少见地诚实:Pro 的 30 步跑了 123.1 小时,中间经历 GPU 双比特错误、K8s 崩溃、grader 失联,还有一次某专家在微批内吃到 30 倍于均值的 token 量导致 OOM。
一半价值在账本。把一次旗舰级 agentic RL 的总成本(260 万美元)、成本结构(grader 只占 12.7%)和失败模式全部摊开,此前没有公开报告做到这个程度。可搬的结论至少四条:MoE 上做这个规模的 RL 先冻结 router;大 batch 训练用 Muon 系优化器;治冗长和 hack,把 grader 算力花在组内相对比较上;环境多样性可以靠最小 harness 重组来造。开源的是 RL 全栈:带验证器的任务环境、训练框架、训练动态、9B 蒸馏模型和 mini-harness,做 agentic RL 的团队可以直接拿来当 baseline。