实验揭示Adam破坏低秩偏差,Muon在低尾能量处表现优异
EtherealGlyph · reddit · 2026-08-13
作者通过实验探讨了为何某些优化器(如 Adam)会破坏梯度下降(GD)固有的低秩偏差。
核心发现:
- 机制差异:在矩阵分解中,损失函数对旋转不变,但 Adam 的逐坐标二阶矩破坏了这一特性,导致丢失低秩偏差。
- 优化器聚类:实验将 9 种更新规则分为两类。GD、Muon 和 Shampoo 保留了低秩偏差;而 Adam、RMSProp 等 则丢失了它。
- Muon 的表现:在真正的低秩目标上表现精确,但随着频谱尾能量的增加(约 4% 处),性能下降最快并 уступает GD。
论文与代码已开源。
所属事件:研究称Adam优化器会破坏模型低秩偏置(2 条相关)→
「研究」频道最新
- Eigen Labs 推出 Yukon:用开放网络突破 AI 前沿研究瓶颈 — gajesh · 2026-08-13
- 开发者观点:用 LLM 玩转 Lean4 形式化数学是件大好事 — _xjdr · 2026-08-13
- Applied Compute 分享企业级 Agent 持续学习:在线提示修复格式与效率 — AI Engineer · 2026-08-13
- AI 编码评测暗箱操作?闭源模型被指刻意隐瞒成绩 — astralmatrix · 2026-08-13
- 为 Meta Glimmer 模型注入动作理解:MotionGlimmer 实践 — andrew_n_carr · 2026-08-13
- Hugging Face 工程师实测:增加 rollout token 预算提升模型胜率 — mervenoyann · 2026-08-13