SEL权重参数化:训练提速1.42倍且可融合部署
7 月 15 日,@torchcompiled 连发多条帖子,集中介绍其提出的权重参数化方法 SymExpLin(SEL)。其核心卖点是:训练阶段把权重表示为 SymExp 与普通线性权重的可学习加权混合,据称最高带来约 1.42x 墙钟训练加速;训练结束后又能融合回标准权重,不额外增加部署负担。这使它同时触及训练效率与落地兼容性两个关注点,作者称这是他目前最有趣的一个项目。
关键机制
根据帖子,SEL 由两部分构成。其一是 SymExp:把传统的加性更新转成更偏乘性的更新形式,并引入可学习的曲率参数;其二是与普通线性权重做可学习混合,而非完全替换原有参数化。作者还提到,这一设计包含与参数幅度相关的 scaling,用来让参数在不同量级下的相对移动与绝对移动更合理。
设计动机
作者回顾称,早先曾尝试在优化器层面动手,但若同时改动每维步长和预条件,训练容易发散,于是思路转向“保持预条件器不动,改为变换权重本身”。他还指出,神经网络许多部分天然带乘法性:以 LayerNorm 缩放为例,1.0 不改变,0.5 相当于减半、2.0 相当于翻倍,但二者在普通优化视角下的“距离”并不对称。另一个出发点是,预训练模型权重常呈重尾分布,而现有 preconditioning 并未真正刻画某些参数需要跨越的优化距离。
当前结论
帖子将 SEL 定位为可回折、可部署的训练加速技巧,作者称最高约 1.42x 墙钟提速。不过这些帖子主要给出设计思路与效果概述,未在材料中展开实验设置、适用模型范围或独立复现结果。
2026-07-15 ~ 2026-07-15 · 7 条相关
一手来源
- 一种可回折的训练加速权重法 — torchcompiled ·
- SEL权重变换提速1.42倍 — torchcompiled ·
- 可学习混合权重提速训练 — torchcompiled ·
- 【源头】一种可回折的训练加速权重法 — torchcompiled · 2026-07-15
- 【源头】可学习混合权重提速训练 — torchcompiled · 2026-07-15
- 预训练权重呈重尾分布 — torchcompiled · 2026-07-15
- 权重尺度的优化距离不对称 — torchcompiled · 2026-07-15
- 从优化器转向权重变换 — torchcompiled · 2026-07-15
- 【源头】SEL权重变换提速1.42倍 — torchcompiled · 2026-07-15
- 一种可融合部署的训练加速技巧 — torchcompiled · 2026-07-15