从 LeCun 到 muP:一篇长文推导 Transformer 初始化与宽度缩放的学习率设计
青稞AI · wechat · 2026-09-19
青稞AI 社区一篇硬核长文,系统推导了 Transformer 初始化与参数化的数学基础,并延伸到宽度缩放下的学习率设计。
文章区分三个问题:初始化时信号能否传播、深层网络中残差与归一化能否维持尺度、模型变宽后超参数是否仍有效。主体脉络:
- LeCun/Xavier/Kaiming 初始化:分别从保持前向二阶矩、兼顾反向传播、计入 ReLU 等非线性这三个角度推导,并给出 Xavier 在非方阵时前向/反向折中的解释。
- 残差与归一化:推导 Pre-Norm 结构下残差流尺度随深度累积的规律,解释为何 attention/FFN 输出投影需按 1/√(2d) 缩放(nanoGPT/GPT-2 的 0.02 初始化由来)。
- muP 参数化:说明 muP 如何同时规定初始化方差、前向乘数与各层学习率随宽度的缩放指数,使不同宽度网络保持常数阶特征变化;推导输出层需要更小初始化方差以容纳训练中的相关特征变化。
- 优化器对比:分别推导 SGD、Adam、Muon 下的学习率缩放,并从谱范数条件统一理解三类参数的缩放指数。
适合想深入理解大模型训练稳定性与 muP 原理的读者。
「研究」频道最新
- 统一 3D 生成模型用于可合成结构药物设计,预印本与代码公开 — charlieharris01 · 2026-09-20
- ICLR 2027 投稿破 6 万篇,近九成疑由 AI 主写 — DominiqueCAPaul · 2026-09-20
- 用 ARM SVE2 指令加速 JSON 解析,simd 已合入实测 — lemire · 2026-09-20
- 90% 数据缺失也能补:先重构动力学几何再填补时序 — bravo_abad · 2026-09-20
- 「LLM 会感到疼痛」研究作者辟谣:我们从未这样宣称 — GaryMarcus · 2026-09-20
- PyTorch 核心开发者推出交互式 Roofline 教程,支持 NVIDIA GPU 分析 — ezyang · 2026-09-20