Inherit4Rec: Parameter Inheritance for Efficient Scaling of Recommendation Models
Ruihao Zhang, Bo Chen, Xiao Wang, Jinlong Jiao, Tijian Hu, Qinglin Jia, Xiuqiang He, Xiangyu Zhao, Chaoyi Ma, Ruiming Tang, Wenwu Ou
cs.IR
2026-09-20
把训好的 Dense 推荐模型直接扩宽或转稀疏 MoE:函数保持生长加共激活分区,快手实测离从头训只差 0.12% GAUC,增量训练费省 72%。
工业推荐系统加容量的标准动作是训一个更大的 Dense 模型,快手把账算得很清楚:一个 0.3B 的 UniFormer 从头训到收敛要超过 25 万 GPU 时,而容量升级会反复发生,每次从头来既费钱,也让线上长时间停在次优模型上。另一头,稀疏 MoE 能把推理算力降到原来的几分之一,但 Dense 权重已经花大钱训出来,转 MoE 通常意味着重训,前面的投入作废。参数继承(把旧权重按结构对应搬进新模型)在 NLP 里有 net2net、bert2BERT、LLaMA-MoE 一脉的方法,但推荐数据的分布天天在漂,这些按静态语料设计的方法直接搬过来会明显掉点。
Inherit4Rec 定义两条变换路径,都作用在 SwiGLU FFN 上。
D2D,Dense 往大长。gate 和 up 投影复制 c 份,宽度从 d 变 (c+1)d;同时新采样一组 down 投影并做零中心化,让各副本加起来为零。这样扩容瞬间新网络的前向输出与旧网络严格相等,老能力一点不丢;零和的 down 行还打破了副本间的梯度对称,训练中副本自然分化。配套的非对称训练:继承参数带着原有 Adam 动量矩和学习率日程继续走,新参数从零动量起步,单独走 warmup 再衰减的日程。
D2S,Dense 转稀疏。先对当前数据流做一遍只前向的校准,按均方贡献给每个通道打分:贡献最高的 m 个通道组成常开的共享专家,其余通道按共激活相似度聚成 R 个路由专家(容量约束下的贪心播种加交换精化),路由器重新初始化,再加 Switch 式负载均衡损失。线上每个 token 只算共享专家加一个路由专家,激活宽度约为原来的四分之一。
KuaiRand-1K 公开数据集加快手工业短视频数据,各四个预测目标,按 GAUC 计分:
工业侧 D2D 把模型从 28M 长到 74M 参数(FFN 中间维 256 到 1024),D2S 激活比 1:4。消融:去掉零和约束掉 0.066 到 0.169 个百分点,去掉优化器状态继承掉 0.093 到 0.254,去掉共激活分区掉 0.132 到 0.240,是最大的单项。
这些数字看着小,但工业排序里千分之一的 GAUC 就是可感知的业务差异,而且全部对比在同一数据流上续训,分母是真金白银的 GPU 时。
给反复扩容的工业团队一条省钱路径:扩容当天模型保持原性能,之后只涨不跌,跳过「新模型冷启动不如旧模型」的窗口期。D2S 让已经付过钱的 Dense 训练成果平移进低算力 serving 结构。机制上没有任何推荐特有的东西,SwiGLU FFN 是 LLM 标配,同一套做法对其他非稳态数据上的继续预训练也适用。
方法只覆盖 per-token FFN,注意力层和其他模块没碰;论文验证的是单次变换,反复做 D2D、D2S 的链式演化只有展望没有实验;稀疏路由每 token 只算通道子集,精确保持前向在数学上做不到,只能逼近;工业结论依赖快手的流量形态,公开数据集上最大 302M 参数,离超大规模仍有距离。