小米MoE强化学习稳定性论文:GRPO改造详解

tokenbender解读arXiv论文《Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts Models》,聚焦小米MoE模型RL训练的思路:未采用花哨新算法,而是在标准GRPO基础上为稳定性与规模化做针对性改造,包括router感知的重要性采样重缩放、以prompt均值损失替代token均值损失等关键修改。

2026-09-22 ~ 2026-09-22 · 2 条相关

事件全程(共 2 集)→