Explainable Recommendations at Scale: LLM Rationales for YouTube Music Artist Discovery
Xiao Liu, Yanwei Song, Srivaths Ranganathan, Yuan Chen, Zheyun Feng, Parker Steenburgh, Jochen Klingenhoefer, Nathan Lasche, Gergo Varady, Tim Steele
cs.AI, cs.IR
2026-09-21
Gemini离线生成未听过艺人候选和自然语言理由,在线只取缓存。两周A/B显示YDD货架互动+22.43%、发现留存+8.07%;关掉理由几乎抵消全部增益,延迟只增0.3%。
音乐流媒体同时要让用户马上听到熟歌,又要让他们点开没听过的艺人。后一件事卡的不是候选不够,是不敢点:面对陌生艺人,协同过滤只给一个分数,启发式文案是「For Fans of X」「Sounds like Y」,过不了相似度阈值的歌根本上不了探索货架。
LLM能写清楚「为什么推荐给你」,也能用世界知识从稀疏听歌记录里拉出语义相近的新艺人。问题是对千万日活做实时生成既贵又慢,亚秒延迟预算装不下。Google把这件事做成YouTube Music上的工业案例:推理全部挪到离线,在线只取预计算好的发现档案。
两段式架构。离线段在用户打开YouTube Music首页时按需触发,而不是给全量用户做日批。若档案还没算完,在线层回退到原来的启发式发现,保证首屏不被拖慢。算完后缓存,后续会话直接用。只给活跃用户跑推理,省掉沉默用户的算力。
生成器用Gemini读完整听歌历史,切成若干口味簇,再为每个簇提名用户多半没听过的艺人,并写一句自然语言理由。理由和提名绑在一起,相当于强制Chain-of-Thought。例子是YDD货架上Stephen Sanchez的卡片底下写:「像Laufey那样,把上世纪中叶的crooner味道翻成当代版本」。
质量靠两道闸。第一道是LLM-as-a-Judge:用更强的离线模型Gemini 3.1 Pro按1–5分打口味簇内聚和候选对齐,低于3分就产出替代艺人和失败理由。失败模式主要是风格跑偏、实体幻觉(把导演、作词人当成歌手)、语言不一致。用这些失败模式改prompt,而不是微调权重:及格率从64.8%提到74.4%。第二道是知识图谱对齐,生成的艺人字符串必须映射到真实实体ID,才能滤掉「Gavin DeBardeleben」这种构词合理但不存在的名字,以及用高棉语音节拼出来的假名。然后再拿完整听歌史做熟悉度过滤,保证货架上的是真没听过的;违规文案直接丢。
在线层做两件事:用档案里的艺人约束已有召回模型,往候选池里加歌;把LLM理由贴到所有对得上的候选上,包括基线碰巧召到的那些。基线YDD是经典两阶段:多路召回、启发式理由(协同/音频embedding余弦过阈值才挂文案)、深度排序、货架打包。没有理由的候选不上YDD。
成本上,档案生成走低优先级、可抢占的TPU,刷新周期和日峰值错开。论文写的服务规模是数千万日活。
两周在线A/B,对照是生产启发式理由,处理组注入LLM候选并给合格条目挂自然语言理由。
| 指标 | 变化 | 95% CI |
| 新召回源带来的播放 | +4.1% | 未给 |
| 新召回源独特性 | 74.00% | 未给 |
| YDD货架互动 | +22.43% | [16.93%, 27.93%] |
| YDD发现留存 | +8.07% | [0.90%, 15.24%] |
| 在线均延迟 | +0.3% | 未给 |
多臂holdback把提名和理由拆开:只关LLM理由、界面和候选池不动,互动回落幅度接近整系统撤回;只关新召回源,互动接近中性。发现指标则两条都关会掉、只关一条也会部分掉。理由是货架互动的主因,发现则要候选和理由一起才站得住。上线后YDD进入首页前三位置的比例明显升高。
这是一份可抄的工程配方,不是新的生成式召回算法。LLM不进请求路径,亚秒SLA就还能保住。Judge加知识图谱把幻觉收成可上线的实体,prompt迭代替代微调。holdback说明「会写理由」本身比「多一路召回」更能让人点陌生艺人;启发式相似度阈值反而把一批本来能讲清楚的候选挡在货架外。
对做探索场景的人,可迁移的是解耦、实体对齐、以及用holdback分清「解释」和「提名」各自贡献了什么。
没有报绝对互动率和样本量,只有相对提升。实验窗口两周,新鲜感是否会衰减不知道。Judge和生成器都是Gemini家族,存在自评偏袒,论文没给人工标注对照。只覆盖YDD货架,没说对主播放页、搜索、电台是否有伤害。延迟+0.3%是均值,峰值和尾延迟没给。按需生成意味着冷用户前几次仍走启发式,论文没拆这群人的指标。理由写得好不好、会不会显得冒犯,没有用户侧质性评估。