Nora 优化器:只取 Muon 矩阵结构精华,避开全量预处理开销
burkov · x · 2026-09-03
Burkov 解读来自南开、人大、清华、西安交大团队的新优化器 Nora:
- 问题:训练大 Transformer 部分是优化器设计问题。Muon 这类方法利用权重矩阵结构选更好的更新方向,但完整利用该结构计算昂贵;便宜的近似又会扰动权重范数——而在某些网络中,改变权重尺度往往对网络函数影响很小。
- 做法:Nora 先把动量中指向权重矩阵每行的分量去掉,使更新只改变行的方向而不无谓改变行长度,再对每行归一化。
- 结论:这个简单操作近似实现了结构化的更新重缩放(preconditioning),以低成本保留了 Muon 式结构信息的有效部分。
「研究」频道最新
- RSA-260 被成功分解,刷新通用大数分解世界纪录 — marvinvonhagen · 2026-09-03
- Scott Aaronson 悼念「怪圈」:自我指涉并非智能的秘密 — jfischoff · 2026-09-03
- 简单方法胜出:线性变换在单细胞批次校正上击败深度学习 — arjunrajlab · 2026-09-03
- SimLoss 单遍细粒度图像描述,低延迟媲美多阶段方法 — Suryaansh Jain · 2026-09-03
- Tenstorrent 联手日本机构推 JapanFold,免费提供开源制药模型推理 — DavidBennett__ · 2026-09-03
- Until 用 AI 把低温保护剂候选分子筛到 25 万个 — NirantK · 2026-09-03