快手落地:条件对齐框架 ConAlign 用少量无偏数据同时提升推荐多样性与 7 日留存率

ConAlign: Conditional Alignment Framework for Balancing Biased and Unbiased Recommendation

Jingcheng Zhang, Yihan Wang, Qi Song, Liyin Hong

cs.IR

2026-07-27

ConAlign 用双塔条件对齐在快手生产系统实现去偏推荐,7 日留存 +0.029%、兴趣多样性 +0.097%,训练速度比 InterD 快 86 倍,Yahoo! R3 无偏 UAUC 0.6841 超过所有基线。

这篇在解决什么

推荐系统的训练数据来自真实用户行为日志,这份数据充满曝光偏差(只有被展示的物品才有交互)、选择偏差(热门物品互动率天然更高)和位置偏差。这类偏差让模型把平台展示策略当成用户真实偏好来学,强化热门物品并收窄用户看到的内容范围。快手团队在真实数据中观察到:用户兴趣多样性指标 VIN(Valid Interest Number)与 7 日留存率(LT7)正相关。

修复偏差的标准手段是引入随机流量数据:以固定小概率插入完全随机曝光,收集到的交互近似满足随机缺失(MAR)假设。两个问题让这个方案难以落地:随机数据量极少;过度追求无偏可能让模型在有偏真实服务环境下的准确率下降,损害短期用户体验和平台收入。

现有最优方法 InterD 靠双师元学习和全用户-物品笛卡尔积插补来解决这个权衡,在 Yahoo! R3 上需要 10,592 秒才能跑完训练,无法用于流式在线系统。

方法

ConAlign 使用双塔结构。有偏塔用完整特征集(含历史共现的记忆特征和通用属性特征)在大规模有偏日志上训练;无偏塔只用通用属性特征,在少量随机流量数据上训练。

核心是条件对齐损失。无偏塔总损失为 Lu = Ld + λ × Lalign,对齐损失 Lalign = Icond × (1/N) Σ ‖hd - sg(hb)‖,条件门控 Icond = 1 当且仅当有偏塔在该样本上的逐实例预测损失低于无偏塔。sg(·) 是停止梯度操作,梯度不回传到有偏塔。

对齐只发生在有偏塔「更可靠」的样本上:已被有偏塔学好的知识选择性地传递给无偏塔;对有偏塔答错的样本不对齐,让无偏塔按自己的无偏信号学习。对齐发生在最后隐层表示层面(而非预测分数层面),保留更丰富的结构信息。线上服务只用无偏塔的预测分数。

随机流量通过永久运行的随机干预机制收集:以固定小概率从完整物品库随机选一个物品插入 feed 的随机位置,对用户体验影响极小。

结果

离线实验(Coat、Yahoo! R3、KuaiRand-Pure,无偏测试集):

数据集ConAlign UAUCInterD(次优)提升
Coat0.68560.6792+0.0064
Yahoo! R30.68410.6787+0.0054
KuaiRand-Pure0.63720.6251+0.0121

训练耗时对比(Yahoo! R3):ConAlign 122.7 秒,InterD 10,592.1 秒——快约 86 倍。

快手生产 A/B 测试(7 天 AA 确认后,10% 用户流量长期观测):

指标变化显著
DAU+0.069%
7 日留存(LT7)+0.029%
有效兴趣数(VIN)+0.097%
内容集中度(CC,低=多样)-0.083%
完整播放量+0.277%

在成熟推荐系统上,DAU 和 LT7 的显著正向变化属于实质性改进。

为什么重要

ConAlign 把「去偏是否会损害线上指标」的两难问题转化为可工程化的选择。条件门控是关键:不是一刀切地用有偏知识覆盖无偏学习,而是只在有偏塔更可信的样本上输出知识。这解释了为什么 ConAlign 能同时改善无偏测试集准确率和有偏环境线上指标。对部署推荐系统的工程团队来说,86 倍速度优势让它可以在生产级流式训练中运行。

局限与存疑

框架要求线上长期运行随机流量干预机制,没有这套基础设施的平台无法直接应用。MAR 假设要求随机插入是严格无偏的,位置选取如果有系统性偏差会破坏理论保证。对齐权重 λ 过大会显著损害无偏 UAUC,需要谨慎调参。离线实验用 MF 作为统一 backbone 以保证对比公平,与生产环境深度 DNN 之间存在差距。

术语

原文与代码

社区讨论

相关论文

全部论文解读