Lightweight Ranking Heads: Accelerating Multi-Task Experimentation in Production Recommender Systems
Sanjay Surendranath Girija, Aniruddh Nath, Li Wei, Yanhao Jiang, Shawn Andrews, Lukasz Heldt, Yi Wu, Aditya Mahajan, Mohit Sharma
cs.LG, cs.AI
2026-09-22
YouTube用停梯度和每日重置的轻量排序头,把新任务注入在线多任务模型而不重训backbone;联合实验从17天降到5天,全周期24天降到11天,稀疏任务AUC接近完整头。
YouTube这类生产推荐的排序阶段是多任务大模型:共享塔加一排预测头,输出再交给下游的奖励模型或手调公式。加一个新目标通常要冷启动整座backbone,还可能和现有任务抢梯度。更麻烦的是预测空间变了,下游模型必须等上游实验打出足够日志才能共训。流量被几十个A/B切开,单实验样本很少,这一等就是数周。上游主模型加了新头,在跑的上百个实验模型还得逐个catch-up,上线窗口能拖到两三个月。
Light Heads要的是:新任务能立刻挂上正在连续训练的排序模型,不碰共享表示,并且所有在线模型输出同一套预测,好让下游一起吃数据。
框架分两块。一块是模型代码外的中心配置,写明标签、损失、激活、分类还是回归、监控指标,以及可选的采样和加权。另一块是各排序模型读这份配置、在训练时把浅塔接到计算图。头通常接在和主头同一层,吃同一座共享塔。
关键约束有两条。停梯度卡在轻量头底部,反向传播改不了共享层,新头之间也不互相污染。每个训练run开始时把头参数重置,checkpoint不持久化,所以老实验模型不会因为多训了几天就比新模型「更熟」。浅塔加停梯度让头能在单次run里收敛。导出serving发生在run结束之后,重置造成的AUC深坑不会被用户看见。
配置在run开始时读一次并冻结,避免中途改头导致checkpoint对不上。serving侧给缺失的轻量头准备默认值,过期模型也能出数。下游看的是全舰队聚合质量,不是某一座模型的离线分。极稀疏的头可以关掉重置、用旧checkpoint热启动。主头被全局损失压住、不肯为小垂直加权重的切片,也可以单独用轻量头在该切片上训,不动共享层。
对照在YouTube Home和Watch Next的生产排序模型上做。轻量头带停梯度、每run重置;完整头从step 0冷启动、无停梯度、跟模型同寿。轻量头在120万步之后热插入。
| 头 | 完整头 | 轻量头 |
| P(CTR) AUC | 0.781 | 0.772 |
| E(Positive Sentiment) AUC | 0.9557 | 0.9553 |
| E(Interaction Rate) AUC | 0.9794 | 0.9704 |
| E(Engagement) RMSE | 0.9673 | 0.9675 |
稠密任务轻量头略低,稀疏情感头几乎持平。没有对应完整头的独立任务也能收敛:P(Intent to Revisit) AUC 0.8523,P(Intent to Share) 0.9224。
去掉停梯度会伤主头:P(CTR) AUC从0.7767掉到0.7704,情感从0.9557到0.9541,Engagement RMSE从0.9887坏到0.9975。轻量头自己也跟着变差,因为共享塔被冲突任务带歪了。关掉重置能再挤一点,对数据更少的头更明显,所以配置里允许按头关闭重置。
生产上,排序加下游的联合实验从17天降到5天,全周期从24天降到11天。轻量头一天就能挂到连续训练的排序器上,中心配置让生产模型和实验模型同时出预测,下游不再等某一个实验把日志攒够。验证过的轻量头往往直接留在线上,不再升格成完整头:部署时间和系统复杂度的节省,盖过稠密任务上那一点离线损失。上线例子包括长horizon奖励头,顶线互动+0.03%(p<0.05)、低质曝光−0.40%;以及付费Primetime频道切片,垂直互动+13.83%。
这是给连续学习、多阶段推荐栈写的实验基础设施,不是新的多任务算法。停梯度加无状态头,概念上接近冻结backbone上的adapter。真正值钱的是中心配置:同一套头同时出现在舰队里每一座模型上,下游预测空间不再碎片化。
适用面很窄,也因此很清楚。没有连续训练管道、没有几十个并行A/B、没有吃上游预测的下游模型,这套工程开销不值。单阶段推荐主要省的是不重训backbone的算力,加速实验的那一截拿不满。稠密任务如果连0.01 AUC都计较,论文自己也说更该冷启动完整头。
作者列的前提都硬:连续学习、多模型并行、下游依赖统一预测空间。无状态重置在低频batch训练里站不住,因为头需要足够步数才能在serving前收敛。离线对照承认稠密任务有缺口。顶线+0.03%是统计显著的生产提升,绝对值很小,和实验周期从数周变数天不是同一类新闻。论文没有公开头的层数、参数量和单次run的数据窗口,复现只能停在机制层。