Muon 可能提升Agentic RL
Kai Ruan · hf · 2026-07-20
Muon 可能有助于 Agentic RL 后训练
这项研究考察了在稀疏奖励的 agentic 强化学习里,Muon 是否优于 AdamW,因为它在该场景中的价值此前并不明确。
- 他们在 ALFWorld 上,用 Qwen2.5-0.5B-Instruct 做了与 AdamW 的单种子对照实验。
- 在 GiGPO 下,只把 Muon 用在隐藏层权重矩阵上,最终窗口的验证成功率从 0.290 提升到 0.546,增幅 88%;而高学习率的 AdamW 对照在更新后没有保住成功率。
- 效果会受到 advantage estimator 和 学习率 的影响。
- 在 3e-5 学习率下,Muon 让 GRPO 从 0.161 提升到 0.268。
- 在 1e-5 下,GraphGPO 的 Muon 版本达到 0.901,归一化验证 AUC 从 0.399 提升到 0.556,并且分别提前 30 和 60 次更新达到 0.5 / 0.75 成功率。
作者认为,这些初步结果说明 Muon 值得继续研究,但还需要多种子和跨任务验证。
「编程与Agent」频道最新
- 构建 AI Agent 安全网关:如何自托管多 SaaS 的 OAuth 集成 — Defiant_Cod_2654 · 2026-07-22
- Rowboat 作为开源本地优先 AI 同事上线 — ycombinator · 2026-07-22
- 解析 AI Agent 的 Loops:长周期多智能体协同 — Scobleizer · 2026-07-22
- Scoble 说 AI 的 loops 本质是长运行多智能体工作区 — Scobleizer · 2026-07-22
- Kimi Code 开放候补名单,Moonshot 推进编码产品 — Fabulous_Bonus_8981 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22