使用 Muon 优化器无需批次大小预热
nrehiew_ · x · 2026-08-27
分享的损失曲线显示,单独使用 Muon 优化器会导致极高的梯度范数和残差激活。研究发现,架构和优化器的改变使得最佳超参数向更大的批次大小和学习率偏移,且学习率衰减随模型增大而变慢。主要发现包括:使用 Muon 时不需要批次大小预热,因为小批次的惩罚过大;学习率调整拥有更宽的容错区间。
所属事件:Qwen 披露训练细节:全程 Muon 优化器与残差流设计(5 条相关)→
「研究」频道最新
- Hugging Face 事故复盘:模型策略意识引争议 — akbirkhan · 2026-08-27
- 回顾新冠时期的医院分诊聊天机器人实践 — AryHHAry · 2026-08-27
- JIT-Agent:通过即时 Harness 进化提升模型智能 — NationalUniversityofSingapore · 2026-08-27
- D³-MOPD:通过动态域调度提升多教师蒸馏效率 — Zechen Sun · 2026-08-27
- 前沿模型科学工作流完成率仅 20%?FrontierChallenge 评测揭示 — apodex · 2026-08-27
- Agent-G²:用高斯分布优化长期任务强化学习 — ZhejiangUniversity · 2026-08-27