字节跳动提出TM20K:长序列广告推荐的知识蒸馏新框架
_reachsumit · x · 2026-08-10
字节跳动近期发布了针对电商广告推荐中超长行为序列建模的新研究。传统方法在扩展序列长度时往往面临训练效率低和吞吐量压力,且容易丢失细粒度信息。
该论文提出了 TM20K 框架,通过全 Transformer 建模结合两阶段知识蒸馏来平衡效果与效率。具体而言,模型训练了一个处理完整序列 token 的重型教师模型,同时为学生模型设计了动机明确的 token 合并(token merge)方法,在大幅压缩序列长度的同时维持了性能。该方法成功将广告序列长度从 5K 扩展到了 20K。
「研究」频道最新
- 机器人排行榜遭质疑:每任务仅 5 次试验,作者承诺扩到 15 次 — YuXiang_IRVL · 2026-09-21
- 表格基础模型入局,被调侃「等你发现 xgboost 就晚了」 — burny_tech · 2026-09-21
- Anthropic 在湾区建生物湿实验室,计划让 Claude 指挥实验机器人 — FinanceYF5 · 2026-09-21
- 作者以「Q* 已破解」自嘲式发帖,推出免 Critic 智能体 RL 方法 KLPO — inductionheads · 2026-09-21
- FutureHouse 发布「生物学千禧年问题」:给 AI 出没法刷的湿实验室考题 — burny_tech · 2026-09-21
- 人类意识尚无实证检验,AI 意识判定从何谈起 — burny_tech · 2026-09-21