Qwen 超参数实验:Muon 无需批处理预热且更稳定
nrehiew_ · x · 2026-08-27
研究发现,架构和优化器的改变使得最佳超参数向更大的批处理大小和学习率偏移。关键结论包括:
- 使用 Muon 时不需要批处理预热。
- 学习率容错率更高,在最优值 sqrt(2) 倍范围内均表现良好。
- 稳定性测试显示,在高学习率下,即使梯度范数更大,Muon 也比 Adam 显著更稳定;门控机制显著提升了稳定性。
所属事件:Qwen 披露训练细节:全程 Muon 优化器与残差流设计(5 条相关)→
「研究」频道最新
- Hugging Face 事故复盘:模型策略意识引争议 — akbirkhan · 2026-08-27
- 回顾新冠时期的医院分诊聊天机器人实践 — AryHHAry · 2026-08-27
- JIT-Agent:通过即时 Harness 进化提升模型智能 — NationalUniversityofSingapore · 2026-08-27
- D³-MOPD:通过动态域调度提升多教师蒸馏效率 — Zechen Sun · 2026-08-27
- 前沿模型科学工作流完成率仅 20%?FrontierChallenge 评测揭示 — apodex · 2026-08-27
- Agent-G²:用高斯分布优化长期任务强化学习 — ZhejiangUniversity · 2026-08-27