小米MoE强化学习稳定性论文:GRPO改造详解
tokenbender解读arXiv论文《Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts Models》,聚焦小米MoE模型RL训练的思路:未采用花哨新算法,而是在标准GRPO基础上为稳定性与规模化做针对性改造,包括router感知的重要性采样重缩放、以prompt均值损失替代token均值损失等关键修改。
2026-09-22 ~ 2026-09-22 · 2 条相关
- 第 1 集:小米 MiMo 百万上下文 RL 训练细节引热议(2026-09-22,13 条)
- 第 2 集:小米MoE强化学习稳定性论文:GRPO改造详解(2026-09-22,2 条)
- 不换 GRPO 只做改造:小米 MoE RL 稳定性改进全拆解 — tokenbender · 2026-09-22
- MoE 强化学习稳定性新论文:router 感知的重要性采样重缩放 — tokenbender · 2026-09-22