Multimedia Asset Personalization via Multimodal Embeddings at Netflix
Emma Yanyang Kong, Aditya Deshpande, Bowei Yan, Asad Abbasi, Santiago Castro, Avneesh Saluja, David Fagnan, Ashish Rastogi
cs.IR
2026-08-19
CLIP 图像向量让五套封面模型合成一套,数据最少的短画布离线 IPS 涨 5.7%;自研三模态 MediaFM 做预告片个性化,在线串流相对纯 ID 加 0.193%。
Netflix 首页上的封面图和自动播放预告片是按人挑的。老模型把每张图、每段预告当成一个 ID,看不见画面里是谁、什么色、什么气氛。新剧和新物料几乎没有点击,系统只好退回热门。五个画布(billboard、竖盒、横板、短板、横幅)还各训一套模型,高曝光画布的信号过不去。
这篇不是新算法。双塔检索加预训练向量,工业界早就会。贡献在生产集成:共享的 Embedding Store、请求路径上全部预计算、上线前用廉价代理任务筛向量。作者把失败模式也写进来了。
封面:把 CLIP 的 768 维图像向量拼进物品塔的 ID 向量,过一层 MLP 投回原维度。用户塔和检索栈不动。五个画布合成一套模型。画布曝光量和正样本定义差很多,直接混会让高流量画布吞掉训练。每个样本按该交互类型的长期奖励分数加权,低流量画布按「值多少」而不是「出现多少」占份额。
CLIP 的图文空间还白送一截搜索。首页分和个人化内积之外,再加查询文本向量和封面图像向量的余弦,混合系数 α 线上调。没有新模型,没有新向量。
预告片:早期内容感知版 SeqCLIP 对帧做 CLIP 再平均,没有声音和台词,也没有时间顺序。MediaFM 是站内三模态基础模型,在剧集镜头上预训练。每个镜头拼三种冻结编码器:视觉 SeqCLIP、音频 wav2vec 2.0、字幕 text-embedding-3-large,合成 2304 维,再进 BERT 式 Transformer,目标是掩码镜头预测。预告片向量取该片在整部剧上下文里的镜头向量做均值,比单独编码预告片更准。
三条预计算把延迟打平。物料入库就算向量,物品塔输出按物料缓存,每天只给每个用户画像的约 500 部头部剧物化选品,其余走非个性化热门。头部覆盖了用户实际看到的大多数位置,预计算成本最多砍一半。离线指标用探索流量上记录下来的精确倾向做 IPS,不估倾向。
新向量上线前还有一道闸:只用内容向量、线性探针,预测一部剧在均匀曝光下的热门赢家。筛掉明显弱的,再做端到端 IPS 和 A/B。
封面三项消融,离线 IPS 相对旧的分画布模型:
| 画布 | 只加 CLIP(V1) | 只合并模型(V2) | 合并+CLIP(V3) |
| 短板 | +1.065% | +2.243% | +5.691% |
| 横幅 | +0.421% | +1.654% | +1.667% |
| 横板 | −0.027% | +0.245% | +1.087% |
| billboard / 竖盒 | 持平或略降 | 持平或略降 | 近乎持平 |
全平台至少四周的 A/B:V1 发现指标 −0.0265%(不显著),V2 +0.0236%(不显著),只有 V3 +0.127%(p<0.005)。Eclipse 新电视 UI 把主画布从竖盒切到短板,上线期间 holdback:发现指标 +0.233%,串流时长 +0.184%。按 2025 年约 1910 亿小时外推,约合每年多 3.5 亿小时。搜索页查询感知封面把播放率再加 0.36%(p<0.05)。
预告片相对纯 ID:SeqCLIP 离线 IPS +0.332%、在线串流 +0.187%;MediaFM +0.380% / +0.193%。代理任务相对乱选:MediaFM 准头高 25.90 个点,SeqCLIP 高 18.75,排序和线上一致。
可迁移的不是「再叠一个融合模块」,是三件工程决定。向量平台和个性化模型解耦,新基础模型注册就能被下游用。请求路径上什么都不跑模型,延迟 SLA 不用为多模态放宽。上 A/B 之前用线性探针把候选向量砍掉一批。对已经有双塔的团队,改动最小的做法是物品塔加冻结向量,再认真处理画布混样。
互补性是这篇最硬的课。CLIP 或合并单独做,线上都不动;合在一起才动。高流量画布先教会共享物品塔「这维图像向量怎么映射到口味」,低流量和新物料才能当天用上。
线上相对涨幅都在零点几个百分点,绝对值靠 Netflix 的规模才好看。V1、V2 单独不显著,说明「加内容特征」在容量不够时会被判无效。MediaFM 相对 SeqCLIP 的在线差只有 0.006 个点,视觉已经够用的预告片上,声音和字幕是冗余的;作者承认收益集中在画面说不清语气的片子,尤其是电视自动播放。代理任务预测的是非个性化热门,不能度量个性化质量,只拿来淘汰。附录写明 MediaFM 继承冻结编码器丢掉的信息,跨模态融合也不是联合学的。每天只物化约 500 部头部剧,长尾仍走热门。