Netflix 用 CLIP 与自研三模态模型重构推荐素材个性化,冷启动大幅改善
_reachsumit · x · 2026-08-20
Netflix 发表论文介绍多模态嵌入如何重塑其生产推荐系统。核心内容:
- 图片素材个性化:在双塔模型中加入 CLIP 图像嵌入,使单个模型覆盖 Netflix 全部 5 种封面画布类型,取代原先 5 个单独训练的模型,并显著改善新上线内容的冷启动表现;还复用 CLIP 的图文联合空间,让搜索中的封面个性化具备查询感知能力。
- 视频预览个性化:自研三模态基础模型 MediaFM 融合视觉(SeqCLIP)、音频(wav2vec 2.0)与时间文本信号,在 Netflix 剧集镜头语料上训练,离线与在线 A/B 测试均优于纯视觉基线。
- 论文还总结了基础模型嵌入引入推荐系统的可迁移实践经验,并设计了简单的离线代理任务用于上线前评估。
「研究」频道最新
- ChatGPT 引用 Reddit 暴跌 86%?分析称是搜索机制变了 — gaganghotra_ · 2026-08-20
- KAIST 可扩展可信 AI 组开放 2027 秋季博士申请 — coallaoh · 2026-08-20
- Liquid AI 发布量化感知蒸馏技术,Q4 模型保留 97% 性能 — alexcovo_eth · 2026-08-20
- OpenBMB 发布 Ultra-FineWeb-L1 数据集,规模达数十亿级 — openbmb · 2026-08-20
- NVIDIA 工程师将深度解析从基座模型到智能体的后训练技术栈 — aiwithaish · 2026-08-20
- 机器人迎 GPT-3 时刻,但谁在将其绑定语言模型? — k7agar · 2026-08-20