微软提出 ESRL:锚定高置信专家提升 MoE 强化学习探索
MicrosoftResearch · hf · 2026-09-15
- 微软研究院提出 ESRL(Expert-Space Exploration in MoE RL),改进混合专家语言模型的强化学习。
- 方法要点:
- 以锚定的高置信专家为基准探索专家路由空间;
- 引入熵自适应扰动,按路由不确定性调节探索强度;
- 使用路径回放(path replay)提升 rollout 多样性。
- 目标是提升 MoE 模型 RL 训练中的探索效率与整体性能。
「研究」频道最新
- AI Beyond Scaling 播客上线,BOLD Fellows 首批申请今日英国时间中午截止 — j_foerst · 2026-09-15
- Grouped Value Attention 分组存值按需重建 Key,压缩 KV Cache — Vishesh Tripathi · 2026-09-15
- Amazon MInTRL:稀疏离策略干预提升在线策略 RL 探索 — amazon · 2026-09-15
- 无状态故障转移丢失近 100% 上下文,ContinuityBench 提出 99.2% 保持率方案 — its_vayishu · 2026-09-15
- Phillip Isola 团队另辟蹊径:超快模拟器让 RL 从零起跑 — AjdDavison · 2026-09-15
- 只读前 50 条就漏掉 75% 少数证据:AI 验证器省成本实测 — iMiguelmars · 2026-09-15