小米 MiMo 用 JAX+TPU 跑通 310B 全参数 RL,扩容只改配置

AccBalanced · x · 2026-09-22

小米 MiMo 团队披露其基于 JAX + TPU 的大规模强化学习实践:在 1000+ TPU 上对 310B 参数的 MiMo-V2.6 完成全参数 RL 训练,并稳定跑了 1000+ 步。亮点包括:扩大规模主要是改配置而非重写代码;配合优化过的 vLLM 推理加速 rollout;训练器与采样器实现逐位(bitwise)一致;两者共享同一 TPU ICI 网络,310B 全部参数传输耗时不到 2 秒。团队与 Berkeley AI、Google Cloud 合作,称后续会分享更多细节。

所属事件:小米发布 MiMo-V2.6:RL 大规模扩展与 JAX+TPU 训练实践(10 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →