MoE 强化学习稳定性新论文:router 感知的重要性采样重缩放
tokenbender · x · 2026-09-22
tokenbender 解读 arXiv 论文《Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts》(北京邮电/微软系团队,含 Furu Wei)及小米相关消融实验:
- 现有 RL 研究多聚焦 dense 模型,MoE 架构的 RL 训练不稳定性长期缺乏研究
- 论文提出 router-aware 方法优化 off-policy RL 的重要性采样(IS)权重:用 router logits 引导重缩放,降低梯度方差、缓解训练发散
- 实验显示方法显著提升 MoE 模型收敛稳定性与最终性能
- 作者点评 5.4 节的 router freezing 部分是有意思的经验技巧,小米的消融实验做得不错
所属事件:小米MoE强化学习稳定性论文:GRPO改造详解(2 条相关)→
「研究」频道最新
- Interconnects 播客:与 Epoch AI 辩论 RSI、美中差距与前沿训练配方 — natolambert · 2026-09-22
- 播客深谈前沿 AI 未来:机器人、中国模型差距与开源安全 — natolambert · 2026-09-22
- 罗福莉复盘小米 MiMo-V2.6:单步生成 2.5 万条 Agent 轨迹 — bookwormengr · 2026-09-22
- 机器人公司破局之道:先部署再用协同感知补能力短板 — broodsugar · 2026-09-22
- 实验显示 Qwen 内部藏有微小的 GPT2 自我模型 — paraschopra · 2026-09-22
- 图神经网络加倾向模型,分离病毒-宿主预测中的生物与采样偏差 — bravo_abad · 2026-09-22