字节跳动提出TM20K:长序列广告推荐的知识蒸馏新框架

_reachsumit · x · 2026-08-10

字节跳动近期发布了针对电商广告推荐中超长行为序列建模的新研究。传统方法在扩展序列长度时往往面临训练效率低和吞吐量压力,且容易丢失细粒度信息。

该论文提出了 TM20K 框架,通过全 Transformer 建模结合两阶段知识蒸馏来平衡效果与效率。具体而言,模型训练了一个处理完整序列 token 的重型教师模型,同时为学生模型设计了动机明确的 token 合并(token merge)方法,在大幅压缩序列长度的同时维持了性能。该方法成功将广告序列长度从 5K 扩展到了 20K。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →