专题 · FULL STORY
小米MiMo百万上下文RL训练细节曝光引热议
小米MiMo模型在100万token上下文上进行强化学习训练的细节在海外技术社区引发热议,被指疑似业内首次;随后其关于MoE强化学习稳定性的GRPO改造论文也被解读,进一步延伸了对该训练方法的讨论。
2026-09-22 ~ 2026-09-22 · 2 集 · 15 条
第 1 集 · 小米 MiMo 百万上下文 RL 训练细节引热议(2026-09-22,13 条)
小米 MiMo 的强化学习训练细节在海外技术社区引发热议。stochasticchasm 认为其疑似业内首次在 100 万 token 上下文上做 RL 训练,且仅约 30 步就取得戏剧性性能提升,训练曲线未见平台期;tokenbender 则从算法改造与训练效率角度做了系统拆解。双方的关注共同指向一个结论:超大批次、稳定化的标准 GRPO 就可能带来远超预期的样本效率。
已确认
- MiMo 采用经典架构,被 stochasticchasm 评价为 simple and strong。
- 训练每步批次规模极大:1568 个任务 × 每任务 16 个 rollout,整轮训练消耗大量 token。
- stochasticchasm 指出模型仅经约 30 步 RL 就大幅提升,远少于其预期;训练曲线看不到平台期迹象,他与转评者 nrehiew 均质疑为何没有继续训练。
- 训练采用非常标准的 GRPO 形式,尚未引入部分团队已开始使用的 critic 模型。stochasticchasm 推测大批量可能已足够降低梯度噪声,即便不扩大 group size 也可行。
- tokenbender 梳理了该方案坚持 GRPO 的多项针对性改造:用 prompt 均值损失替代 token 均值损失(DAPO),避免长回答获得过多梯度权重;正负优势分别设置裁剪边界等,核心思路是不换更花哨的算法,而为稳定性与规模做修改。
- tokenbender 解读称高吞吐、异构环境及仅 13% 的 policy drift staleness 说明所选环境大多可直接在基座权重上运行或改进,不需依赖课程学习。
- 工程取舍上未采用 PipelineRL(保留旧 KV cache)的做法,而是策略更新后重新 prefill。stochasticchasm 推测原因是整个 run 只有约 30 步,每步策略变化较大,重新 prefill 或许划算。
- stochasticchasm 观察成本构成后指出 grader(评判模型)消耗了大量算力,并好奇对方用的是哪个模型做 grader;Agent 裁判或成新的扩展轴。
- tokenbender 解读报告第 6 点 MOPD2 时推测该部分可能在早前已完成,并非本次 RL replay/live 的一部分,并认为专家教师设计比大规模混合 RL 更有效。
尚未确认
- 「1M 上下文 RL 训练」为 stochasticchasm 根据技术材料做出的推断,原文表述为「疑似」。
- 有研究者批评该方案缺少 batch 规模消融实验,大 batch 是否足以替代更大 group size / critic 仍是猜测;MOPD2 的完成时点亦属 tokenbender 的推测。
为什么重要
- 若 1M 上下文 RL 训练属实,将是扩展轴上的新突破,长上下文 Agent 任务可能因此受益。
- 30 步即逼近前沿性能,加上 13% 策略漂移与无需课程学习的证据,说明超大批次 RL 的样本效率可能远超此前认知,对后续训练策略具有参考价值。
- GRPO 的稳定性改造清单、grader 算力占比高、重新 prefill 的取舍等细节,为业界理解大规模 RL 的成本结构与基础设施设计提供了少见的一手参照。
- 仅 30 步 RL 训练带来大幅性能跃升,研究者惊讶未见平台期 — stochasticchasm · 2026-09-22
- 仅 30 步 RL 模型大幅提升,作者惊讶未见平台期 — stochasticchasm · 2026-09-22
- 经典 MiMo 架构配超大批次强化学习,1568 任务×16 rollout 仍出人意料 — stochasticchasm · 2026-09-22
- 小米 MiMo 疑似首个 1M 上下文 RL 训练,Agent 裁判成新扩展轴 — stochasticchasm · 2026-09-22
- GRPO 大 batch 训练引技术争论:批评者称缺 batch 规模消融 — stochasticchasm · 2026-09-22
- 从业者讨论百万规模 RL 训练:标准 GRPO 为何不用 critic 模型 — stochasticchasm · 2026-09-22
- 技术评论:某 RL 训练弃用 PipelineRL 保留 KV cache,改用重新 prefill — stochasticchasm · 2026-09-22
- RL 训练细节讨论:不用 PipelineRL 保 KV cache,反而选择重新 prefill — stochasticchasm · 2026-09-22
- RL 训练大量算力花在 grader 上,跑 30 步值得重新 prefill 吗 — stochasticchasm · 2026-09-22
- 小米模型仅 30 步 RL 即逼近前沿,且未见平台期 — teortaxesTex · 2026-09-22
- 13%策略漂移与高吞吐:RL训练或无需课程学习的证据 — tokenbender · 2026-09-22
- RL训练稳态秘诀:GRPO改造四板斧拆解 — tokenbender · 2026-09-22
- 小米 MoE RL 训练解读:专家教师比大混合 RL 更有效 — tokenbender · 2026-09-22
第 2 集 · 小米MoE强化学习稳定性论文:GRPO改造详解(2026-09-22,2 条)
tokenbender解读arXiv论文《Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts Models》,聚焦小米MoE模型RL训练的思路:未采用花哨新算法,而是在标准GRPO基础上为稳定性与规模化做针对性改造,包括router感知的重要性采样重缩放、以prompt均值损失替代token均值损失等关键修改。
- 不换 GRPO 只做改造:小米 MoE RL 稳定性改进全拆解 — tokenbender · 2026-09-22
- MoE 强化学习稳定性新论文:router 感知的重要性采样重缩放 — tokenbender · 2026-09-22