从 LeCun 到 muP:一篇长文推导 Transformer 初始化与宽度缩放的学习率设计

青稞AI · wechat · 2026-09-19

青稞AI 社区一篇硬核长文,系统推导了 Transformer 初始化与参数化的数学基础,并延伸到宽度缩放下的学习率设计。

文章区分三个问题:初始化时信号能否传播、深层网络中残差与归一化能否维持尺度、模型变宽后超参数是否仍有效。主体脉络:

适合想深入理解大模型训练稳定性与 muP 原理的读者。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →