YouTube轻量排序头把联合实验从17天压到5天

Lightweight Ranking Heads: Accelerating Multi-Task Experimentation in Production Recommender Systems

Sanjay Surendranath Girija, Aniruddh Nath, Li Wei, Yanhao Jiang, Shawn Andrews, Lukasz Heldt, Yi Wu, Aditya Mahajan, Mohit Sharma

cs.LG, cs.AI

2026-09-22

YouTube用停梯度和每日重置的轻量排序头,把新任务注入在线多任务模型而不重训backbone;联合实验从17天降到5天,全周期24天降到11天,稀疏任务AUC接近完整头。

这篇在解决什么

YouTube这类生产推荐的排序阶段是多任务大模型:共享塔加一排预测头,输出再交给下游的奖励模型或手调公式。加一个新目标通常要冷启动整座backbone,还可能和现有任务抢梯度。更麻烦的是预测空间变了,下游模型必须等上游实验打出足够日志才能共训。流量被几十个A/B切开,单实验样本很少,这一等就是数周。上游主模型加了新头,在跑的上百个实验模型还得逐个catch-up,上线窗口能拖到两三个月。

Light Heads要的是:新任务能立刻挂上正在连续训练的排序模型,不碰共享表示,并且所有在线模型输出同一套预测,好让下游一起吃数据。

方法

框架分两块。一块是模型代码外的中心配置,写明标签、损失、激活、分类还是回归、监控指标,以及可选的采样和加权。另一块是各排序模型读这份配置、在训练时把浅塔接到计算图。头通常接在和主头同一层,吃同一座共享塔。

关键约束有两条。停梯度卡在轻量头底部,反向传播改不了共享层,新头之间也不互相污染。每个训练run开始时把头参数重置,checkpoint不持久化,所以老实验模型不会因为多训了几天就比新模型「更熟」。浅塔加停梯度让头能在单次run里收敛。导出serving发生在run结束之后,重置造成的AUC深坑不会被用户看见。

配置在run开始时读一次并冻结,避免中途改头导致checkpoint对不上。serving侧给缺失的轻量头准备默认值,过期模型也能出数。下游看的是全舰队聚合质量,不是某一座模型的离线分。极稀疏的头可以关掉重置、用旧checkpoint热启动。主头被全局损失压住、不肯为小垂直加权重的切片,也可以单独用轻量头在该切片上训,不动共享层。

结果

对照在YouTube Home和Watch Next的生产排序模型上做。轻量头带停梯度、每run重置;完整头从step 0冷启动、无停梯度、跟模型同寿。轻量头在120万步之后热插入。

完整头轻量头
P(CTR) AUC0.7810.772
E(Positive Sentiment) AUC0.95570.9553
E(Interaction Rate) AUC0.97940.9704
E(Engagement) RMSE0.96730.9675

稠密任务轻量头略低,稀疏情感头几乎持平。没有对应完整头的独立任务也能收敛:P(Intent to Revisit) AUC 0.8523,P(Intent to Share) 0.9224。

去掉停梯度会伤主头:P(CTR) AUC从0.7767掉到0.7704,情感从0.9557到0.9541,Engagement RMSE从0.9887坏到0.9975。轻量头自己也跟着变差,因为共享塔被冲突任务带歪了。关掉重置能再挤一点,对数据更少的头更明显,所以配置里允许按头关闭重置。

生产上,排序加下游的联合实验从17天降到5天,全周期从24天降到11天。轻量头一天就能挂到连续训练的排序器上,中心配置让生产模型和实验模型同时出预测,下游不再等某一个实验把日志攒够。验证过的轻量头往往直接留在线上,不再升格成完整头:部署时间和系统复杂度的节省,盖过稠密任务上那一点离线损失。上线例子包括长horizon奖励头,顶线互动+0.03%(p<0.05)、低质曝光−0.40%;以及付费Primetime频道切片,垂直互动+13.83%。

为什么重要

这是给连续学习、多阶段推荐栈写的实验基础设施,不是新的多任务算法。停梯度加无状态头,概念上接近冻结backbone上的adapter。真正值钱的是中心配置:同一套头同时出现在舰队里每一座模型上,下游预测空间不再碎片化。

适用面很窄,也因此很清楚。没有连续训练管道、没有几十个并行A/B、没有吃上游预测的下游模型,这套工程开销不值。单阶段推荐主要省的是不重训backbone的算力,加速实验的那一截拿不满。稠密任务如果连0.01 AUC都计较,论文自己也说更该冷启动完整头。

局限与存疑

作者列的前提都硬:连续学习、多模型并行、下游依赖统一预测空间。无状态重置在低频batch训练里站不住,因为头需要足够步数才能在serving前收敛。离线对照承认稠密任务有缺口。顶线+0.03%是统计显著的生产提升,绝对值很小,和实验周期从数周变数天不是同一类新闻。论文没有公开头的层数、参数量和单次run的数据窗口,复现只能停在机制层。

术语

原文与代码

社区讨论

相关论文

全部论文解读