字节 TM20K:广告行为序列拉到 2 万,在线 ADSS 涨 1.036% 且延迟仅 +5.6%

Teacher Retains Full Tokens, Student Merges Efficiently: TM20K for E-Commerce Sequence Modeling in Ad Recommendation

Xinchun Li, Duoru Zheng, Wenlin Zhao, Ziyi Zhou, Jingxuan Tan, Huizhi Yang, Linlan Chen, Dongjian Wang, Dongyue Wang, Xiaosong Li, Hongyue Mao, Yaocheng Tan

cs.IR

2026-08-07

超长用户行为序列能让推荐兼顾长短期兴趣,但序列从 5K 拉到 20K 会让训练慢 3.5 倍、推理慢 6.3 倍。字节 TM20K 给师生模型都上全注意力,学生用三种 token 合并把 20K 压到均长 1.8K,再靠一次性老师蒸馏,在线 ADSS 涨 1.036%、延迟仅 +5.6%。

这篇在解决什么

推荐系统靠建模用户的历史行为序列来猜下一个会点的商品。序列越长,越能同时兼顾长期兴趣和当下意图,所以业界一直在把序列往长了拉。但拉长代价很大:作者实测把序列从 5K 拉到 20K,训练时间涨 3.5 倍、显存多 49G、线上推理延迟涨 6.3 倍,直接上线不可行。

已有的两条省钱路子都有硬伤。一类是搜索或聚类式压缩,把长序列压短,但丢了细粒度行为信息;另一类是轻量目标注意力(target attention),只看与候选商品相关的历史,抓不住行为 token 之间的内在依赖。TM20K 想同时拿住效果和效率,把序列做到 2 万还能上线。

方法

核心是「全注意力加 token 合并加一次性老师蒸馏」的组合。

结果

已部署在字节跳动电商广告推荐,序列扩到 20K。在线 A/B:

配置ADSSADVV线上延迟
TM20K 学生(带蒸馏)+1.036%+0.780%+5.6%
TM20K 学生(无蒸馏)+0.881%+0.515%+5.6%

离线用的是工业级 CVR 预测数据集,数十亿样本。5K 基线 AUC 0.8212;20K 全 token 老师 0.8233、吞吐掉到 11K;带蒸馏的学生 AUC 0.8230,几乎追平老师,吞吐 83K(基线 88K,只掉 5.7%),平均序列长度从 20K 压到 1.8K(P90 为 2.6K)。对照基线 STCA、LONGER、MTFM、HyFormer(DIN、TWIN 因在超长序列上太差被排除)。

为什么重要

长序列建模是工业推荐里效果和成本最直接的拉锯点。TM20K 给出的可落地方案是:全注意力该上就上,但把算力负担通过 token 合并和一次性老师蒸馏消化在离线侧,线上只跑压缩学生。对做广告或推荐的人,三种 token 合并规则都来自对注意力分布的具体观察,各自可独立借鉴。

局限与存疑

作者承认两点:一是 token 合并是规则式的,换到别的应用场景需要重新调参;二是没有引入稀疏注意力,因为那需要开发高度定制的 GPU 算子,工程成本高。另外所有结果都来自字节内部的电商广告数据和在线实验,没有公开数据集复现,外部读者只能采信其内部数字。

术语

原文与代码

社区讨论

相关论文

全部论文解读