小米 MiMo 用 JAX+TPU 跑通 310B 全参数 RL,扩容只改配置
AccBalanced · x · 2026-09-22
小米 MiMo 团队披露其基于 JAX + TPU 的大规模强化学习实践:在 1000+ TPU 上对 310B 参数的 MiMo-V2.6 完成全参数 RL 训练,并稳定跑了 1000+ 步。亮点包括:扩大规模主要是改配置而非重写代码;配合优化过的 vLLM 推理加速 rollout;训练器与采样器实现逐位(bitwise)一致;两者共享同一 TPU ICI 网络,310B 全部参数传输耗时不到 2 秒。团队与 Berkeley AI、Google Cloud 合作,称后续会分享更多细节。
所属事件:小米发布 MiMo-V2.6:RL 大规模扩展与 JAX+TPU 训练实践(10 条相关)→
「Infra」频道最新
- AI 数据中心功耗从 5 兆瓦飙到 1000 兆瓦,涨了 200 倍 — Olivier__OG · 2026-09-23
- 开发者用 Rust 写权重流式引擎,RTX 3060 12GB 跑动 FLUX.2 9B — madtune22 · 2026-09-23
- AMD MI355X 每美元性能达 DGX B300 的 1.7 倍 — zephyr_z9 · 2026-09-23
- 云栖大会最大看点不是新模型,而是 AI 全栈生态成型 — manishkhosiya · 2026-09-23
- 本地跑 Qwen3.8-27B:10GB 显存、170ms 延迟、多模态决策 — kyr0x0 · 2026-09-23
- 一周三件事:Gemini 越权访问外网、加州下令.kill switch、苹果重回服务器 — Dapper-Tale-4021 · 2026-09-23