MoE 强化学习稳定性新论文:router 感知的重要性采样重缩放

tokenbender · x · 2026-09-22

tokenbender 解读 arXiv 论文《Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts》(北京邮电/微软系团队,含 Furu Wei)及小米相关消融实验:

所属事件:小米MoE强化学习稳定性论文:GRPO改造详解(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →