ConAlign: Conditional Alignment Framework for Balancing Biased and Unbiased Recommendation
Jingcheng Zhang, Yihan Wang, Qi Song, Liyin Hong
cs.IR
2026-07-27
ConAlign 用双塔条件对齐在快手生产系统实现去偏推荐,7 日留存 +0.029%、兴趣多样性 +0.097%,训练速度比 InterD 快 86 倍,Yahoo! R3 无偏 UAUC 0.6841 超过所有基线。
推荐系统的训练数据来自真实用户行为日志,这份数据充满曝光偏差(只有被展示的物品才有交互)、选择偏差(热门物品互动率天然更高)和位置偏差。这类偏差让模型把平台展示策略当成用户真实偏好来学,强化热门物品并收窄用户看到的内容范围。快手团队在真实数据中观察到:用户兴趣多样性指标 VIN(Valid Interest Number)与 7 日留存率(LT7)正相关。
修复偏差的标准手段是引入随机流量数据:以固定小概率插入完全随机曝光,收集到的交互近似满足随机缺失(MAR)假设。两个问题让这个方案难以落地:随机数据量极少;过度追求无偏可能让模型在有偏真实服务环境下的准确率下降,损害短期用户体验和平台收入。
现有最优方法 InterD 靠双师元学习和全用户-物品笛卡尔积插补来解决这个权衡,在 Yahoo! R3 上需要 10,592 秒才能跑完训练,无法用于流式在线系统。
ConAlign 使用双塔结构。有偏塔用完整特征集(含历史共现的记忆特征和通用属性特征)在大规模有偏日志上训练;无偏塔只用通用属性特征,在少量随机流量数据上训练。
核心是条件对齐损失。无偏塔总损失为 Lu = Ld + λ × Lalign,对齐损失 Lalign = Icond × (1/N) Σ ‖hd - sg(hb)‖,条件门控 Icond = 1 当且仅当有偏塔在该样本上的逐实例预测损失低于无偏塔。sg(·) 是停止梯度操作,梯度不回传到有偏塔。
对齐只发生在有偏塔「更可靠」的样本上:已被有偏塔学好的知识选择性地传递给无偏塔;对有偏塔答错的样本不对齐,让无偏塔按自己的无偏信号学习。对齐发生在最后隐层表示层面(而非预测分数层面),保留更丰富的结构信息。线上服务只用无偏塔的预测分数。
随机流量通过永久运行的随机干预机制收集:以固定小概率从完整物品库随机选一个物品插入 feed 的随机位置,对用户体验影响极小。
离线实验(Coat、Yahoo! R3、KuaiRand-Pure,无偏测试集):
| 数据集 | ConAlign UAUC | InterD(次优) | 提升 |
| Coat | 0.6856 | 0.6792 | +0.0064 |
| Yahoo! R3 | 0.6841 | 0.6787 | +0.0054 |
| KuaiRand-Pure | 0.6372 | 0.6251 | +0.0121 |
训练耗时对比(Yahoo! R3):ConAlign 122.7 秒,InterD 10,592.1 秒——快约 86 倍。
快手生产 A/B 测试(7 天 AA 确认后,10% 用户流量长期观测):
| 指标 | 变化 | 显著 |
| DAU | +0.069% | 是 |
| 7 日留存(LT7) | +0.029% | 是 |
| 有效兴趣数(VIN) | +0.097% | 是 |
| 内容集中度(CC,低=多样) | -0.083% | 是 |
| 完整播放量 | +0.277% | 是 |
在成熟推荐系统上,DAU 和 LT7 的显著正向变化属于实质性改进。
ConAlign 把「去偏是否会损害线上指标」的两难问题转化为可工程化的选择。条件门控是关键:不是一刀切地用有偏知识覆盖无偏学习,而是只在有偏塔更可信的样本上输出知识。这解释了为什么 ConAlign 能同时改善无偏测试集准确率和有偏环境线上指标。对部署推荐系统的工程团队来说,86 倍速度优势让它可以在生产级流式训练中运行。
框架要求线上长期运行随机流量干预机制,没有这套基础设施的平台无法直接应用。MAR 假设要求随机插入是严格无偏的,位置选取如果有系统性偏差会破坏理论保证。对齐权重 λ 过大会显著损害无偏 UAUC,需要谨慎调参。离线实验用 MF 作为统一 backbone 以保证对比公平,与生产环境深度 DNN 之间存在差距。