Muon 在 GiGPO 中几乎将智能体 RL 成功率翻倍
rohanpaul_ai · x · 2026-07-22
Muon 在智能体强化学习里不是“天然有效”,而是高度依赖训练设定。
- 论文把 vanilla Muon 和 AdamW 放在稀疏奖励的 agentic RL 场景里做对比,使用的是单种子匹配实验。
- 在 GiGPO 设定下,Muon 将后期窗口验证成功率从 0.290 提升到 0.546,相对提升超过 88%。
- 作者进一步发现,效果取决于优势估计器和学习率:在 3×10^-5 时,Muon 让 GRPO 从 0.161 升到 0.268;而在 10^-5 时,GraphGPO 的后期表现接近饱和,Muon 的优势变小。
- 结论是:优化器不能脱离 RL 训练结构单独评价,credit assignment 和学习率可能决定它到底是加分还是翻车。
「研究」频道最新
- 视频课程讲解物理约束机器学习的建模与控制 — Vjeux · 2026-07-22
- 健康时间序列基准显示 LLM 仍落后传统机器学习 — yang_yuzhe · 2026-07-22
- AutoLab 基准显示前沿模型靠持续迭代赢下长任务 — rohanpaul_ai · 2026-07-22
- 报告称 Gemini Flash 持平能力、成本降 30–40% — sujingshen · 2026-07-22
- Delineate Anything v2 用 7300 万实例数据集做全球农田边界识别 — Mykola Lavreniuk · 2026-07-22
- KernelBench 新增 CUDA 子基准,并在三种 GPU 上重跑 Fable — TheZachMueller · 2026-07-22