专题 · FULL STORY

小米MiMo百万上下文RL训练细节曝光引热议

小米MiMo模型在100万token上下文上进行强化学习训练的细节在海外技术社区引发热议,被指疑似业内首次;随后其关于MoE强化学习稳定性的GRPO改造论文也被解读,进一步延伸了对该训练方法的讨论。

2026-09-22 ~ 2026-09-22 · 2 集 · 15 条

第 1 集 · 小米 MiMo 百万上下文 RL 训练细节引热议(2026-09-22,13 条)

小米 MiMo 的强化学习训练细节在海外技术社区引发热议。stochasticchasm 认为其疑似业内首次在 100 万 token 上下文上做 RL 训练,且仅约 30 步就取得戏剧性性能提升,训练曲线未见平台期;tokenbender 则从算法改造与训练效率角度做了系统拆解。双方的关注共同指向一个结论:超大批次、稳定化的标准 GRPO 就可能带来远超预期的样本效率。

已确认

  • MiMo 采用经典架构,被 stochasticchasm 评价为 simple and strong。
  • 训练每步批次规模极大:1568 个任务 × 每任务 16 个 rollout,整轮训练消耗大量 token。
  • stochasticchasm 指出模型仅经约 30 步 RL 就大幅提升,远少于其预期;训练曲线看不到平台期迹象,他与转评者 nrehiew 均质疑为何没有继续训练。
  • 训练采用非常标准的 GRPO 形式,尚未引入部分团队已开始使用的 critic 模型。stochasticchasm 推测大批量可能已足够降低梯度噪声,即便不扩大 group size 也可行。
  • tokenbender 梳理了该方案坚持 GRPO 的多项针对性改造:用 prompt 均值损失替代 token 均值损失(DAPO),避免长回答获得过多梯度权重;正负优势分别设置裁剪边界等,核心思路是不换更花哨的算法,而为稳定性与规模做修改。
  • tokenbender 解读称高吞吐、异构环境及仅 13% 的 policy drift staleness 说明所选环境大多可直接在基座权重上运行或改进,不需依赖课程学习。
  • 工程取舍上未采用 PipelineRL(保留旧 KV cache)的做法,而是策略更新后重新 prefill。stochasticchasm 推测原因是整个 run 只有约 30 步,每步策略变化较大,重新 prefill 或许划算。
  • stochasticchasm 观察成本构成后指出 grader(评判模型)消耗了大量算力,并好奇对方用的是哪个模型做 grader;Agent 裁判或成新的扩展轴。
  • tokenbender 解读报告第 6 点 MOPD2 时推测该部分可能在早前已完成,并非本次 RL replay/live 的一部分,并认为专家教师设计比大规模混合 RL 更有效。

尚未确认

  • 「1M 上下文 RL 训练」为 stochasticchasm 根据技术材料做出的推断,原文表述为「疑似」。
  • 有研究者批评该方案缺少 batch 规模消融实验,大 batch 是否足以替代更大 group size / critic 仍是猜测;MOPD2 的完成时点亦属 tokenbender 的推测。

为什么重要

  • 若 1M 上下文 RL 训练属实,将是扩展轴上的新突破,长上下文 Agent 任务可能因此受益。
  • 30 步即逼近前沿性能,加上 13% 策略漂移与无需课程学习的证据,说明超大批次 RL 的样本效率可能远超此前认知,对后续训练策略具有参考价值。
  • GRPO 的稳定性改造清单、grader 算力占比高、重新 prefill 的取舍等细节,为业界理解大规模 RL 的成本结构与基础设施设计提供了少见的一手参照。

第 2 集 · 小米MoE强化学习稳定性论文:GRPO改造详解(2026-09-22,2 条)

tokenbender解读arXiv论文《Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts Models》,聚焦小米MoE模型RL训练的思路:未采用花哨新算法,而是在标准GRPO基础上为稳定性与规模化做针对性改造,包括router感知的重要性采样重缩放、以prompt均值损失替代token均值损失等关键修改。