Google 在 YouTube Music 测试六种反馈回路修正方案

_reachsumit · x · 2026-07-28

Google 在 YouTube Music 上比较六种“破循环”策略

连续训练的推荐模型容易陷入反馈回路,越推越像用户已经听过的内容,结果同时伤害两类目标:新鲜度(新发布内容)和新颖性(未听过的曲库内容)。

论文在 YouTube Music 首页上做了 6 种干预方案的离线校正在线 A/B 测试,并额外做了组合实验。作者指出,只改 serving 层的策略往往会被学习回路抵消;他们还比较了训练重加权、架构去偏和探索策略,结论是 基于不确定性的探索带来的新鲜度提升最大。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →