快手从2.4亿直播用户收集偏好理由,排序侧Hate下降8.2%

Scaling Articulated Rationales for MLLM-based Recommendation

Haoke Xiao, Yueyang Liu, Yuhui Zhang, Xiang Chen, Yufei Liu, Jia Xu, Yalong Guan, Xiaolan Zhu, Xiaoyu Zhang, Shijun Wang, Shuang Yang, Zijie Meng, Zejian Zhang, Ruochen Yang, Xiangyu Wu, Tingting Gao, Han Li, Lantao Hu, Cheng Luo, Kun Gai

cs.IR, cs.AI

2026-09-15

快手从直播问卷筛出十八万七千条用户理由,生成模型覆盖千万主播并写入排序。线上点击升零点三四个百分点,不喜欢反馈下降百分之八点二。

这篇在解决什么

推荐系统很会从点击、完播、点踩里推断用户做了什么,很少知道为什么。同一段完播可能是内容对口,也可能是主播陪聊;同一下点踩可能是硬广,也可能是危险动作。评论和标签描述内容,不一定绑定一次偏好决策。用户用自然语言说出喜欢或不喜欢的理由,是带极性的原因级文本,但工业上几乎没被当成一等特征:覆盖低于1%,口语又短又碎,通用多模态大模型容易编出事后合理化的借口。

SARA要解决的就是把这种稀疏口述理由,变成可日更的排序信号。

方法

数据引擎挂在快手直播问卷上。用户连续看满10秒后,以基准5%的概率出题,概率随近5分钟回复率在1%到20%之间浮动。先选正/负,再写开放理由。在线路由BitCPM4-0.5B打六维分,整体分大于2才发小额快币。2026年2月12日到8月30日收集191万条候选。线下用Agent Judge做不可补偿过滤:相关性、安全、极性、接地任一致命缺陷不能被文笔分拉回来,留下187,532条,通过率9.8%。负向通过率24.2%,高于正向的6.8%,因为负向更指向具体缺陷,正向里水夸更多。82%的单条理由不超过10个汉字。按主播和极性聚合成86,564份作者侧画像,再写成带帧、元数据、ASR、评论和极性指令的多模态样本,问卷原文只当监督、不进上下文。

SARA-7B在这份SARA-HQ上做全参数SFT,再在7K热门主播上自采样、用同一套Agent Judge排序,取第一和最后组成偏好对做Quality-Refining DPO。生成器看到的是主播多模态上下文加极性,不看具体用户,所以产出的是作者级共享理由,覆盖从8.6万有问卷主播扩到约1000万主播。

排序分两支。正向:用户画像、主播描述、正向理由分别查表,共享小编码器,双向交叉注意力得到用户-主播表示,再用互信息最大化把它和理由表示对齐,送进原有MMoE。负向:把负向理由编成三层残差量化的语义ID,挂到用户历史Hate主播上,目标主播做query去聚合相关讨厌记忆,让「反感硬广」迁到没点过踩、但理由相近的新主播。

结果

5K与训练主播不重叠的评测上,冻结的Agent Judge打分(1到4):

模型具体性整体BGE-Sim
Gemini 3.1 Pro2.922.510.70
Qwen3-VL-8B2.672.370.69
SARA-7B-SFT3.073.150.82
SARA-7B-DPO3.323.330.82

连贯、安全、极性各家都高,差距在相关性、具体性和接地。DPO把具体性从3.07抬到3.32,接地从3.63到3.75。SFT数据加量时,这几项继续涨,语言通顺更早饱和。

负向理由的语义ID在(8192)^3码本下SID碰撞率1.5%,低于站内TagNex的7.9%和OneLive MLLM的3.6%。

生产MMoE加上SARM为底,1%流量独立A/B,延迟预算内日更,已跑过30天。正向支路线下Long-view AUC加0.28个百分点;线上点击+0.342%、观看时长+0.986%、有效观看+0.365%、关注+0.616%。负向支路Hate AUC加0.35、Report加0.46个百分点;线上Hate -8.164%、Report -0.4396%、7日留存+0.027%。

为什么重要

工业推荐缺的往往不是更大的多模态编码器,是「用户自己说过的原因」。这篇把问卷、质检、生成、排序串成一条可日更的生产线,并在已经堆满多模态特征的底座上仍给出可测的线上增益。负向SID把点踩从「记住这个作者」变成「记住这类理由」,对低频Report头尤其有用。

适用面很具体:有大规模直播或短视频、能做问卷、能承受主播级共享理由而不是一人一条的场景。没有问卷引擎的团队,直接抄SARA-7B没有监督来源。

局限与存疑

理由是作者级共享的,不是「这个用户为什么喜欢这个主播」。MIM对齐只能让交互表示靠近作者侧话术,个性化深度有上限。问卷在看满10秒后才发,早滑走的负向样本系统性偏少。质检、DPO和生成评测共用同一套Agent Judge,分数优势有自我强化风险,BGE-Sim对问卷原文0.82也是在复述同一分布。线上数字是1%流量、相对强工业底座的增量,绝对值不大;Hate大降需要排除问卷打扰和激励本身改变了反馈行为。论文几乎没写失败案例和跨业务泛化。

术语

原文与代码

社区讨论

相关论文

全部论文解读