NAVER 用 LLM 把评论语义变成 bandit 先验,冷启动 CTR 涨近一成

LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation

Eugene Lee, Oseong Choi, Byungsoo Kang, Taeyeong Jang

cs.IR, cs.LG

2026-08-04

在 Webtoon 评论推荐里,新评论没点击历史,Thompson sampling 的 bandit 没法冷启动。NAVER 用 GPT-4.1 从评论文本里抽语义信号做成 Beta 先验暖启动,按性别×年龄分段更新后验;线上 A/B/C 测得稀疏反馈桶 CTR 最高涨 9.5%,但聚合数字不显著,且换来曝光集中度上升。

这篇在解决什么

场景是 NAVER Webtoon(韩国网漫平台)的评论推荐。平台有约 4000 部活跃作品,用户在发现页靠缩略图、标题和有限元数据快速决策,而这些视觉线索只能部分反映一部作品到底什么样。于是平台加了「评论推荐」,把其他读者写的评论推荐给用户,用评论的语气、角色张力、情感氛围把作品的吸引力具象化。

推荐策略用多臂老虎机(multi-armed bandit)里的 Thompson sampling:每条评论是一个「臂」,用户点不点是奖励,bandit 边展示边学。问题是这是个新上线的组件,每条新评论一开始几乎没有点击历史,Thompson sampling 的后验基本是空的,等于瞎选。这就是冷启动。更细一层,bandit 的参数按性别×年龄分段(2 性别 × 4 年龄段)分别维护后验,不共用一套,因为不同人群口味差很多。

方法

核心想法:在新评论还没有行为反馈时,用 LLM 从评论文本里抽语义信号,做成贝叶斯先验暖启动 bandit;等真实点击攒够了,后验再接管。LLM(GPT-4.1)只离线跑(每天增量重算新评论),线上推理零 LLM 调用,延迟不受影响。

先验是加性结构:一个共享的 base score(评论对所有人普遍的「钩子」强度)+ 一个调整项。论文试了两种调整:Gender Prior(按性别的人群偏好信号,调整范围 −0.350.40,缩放系数 2.0)和 Content Prior(作品特有身份信号,范围 01,系数 1.0)。base score 的 prompt 让模型估一个类 CTR 的分(绝大多数评论低于 0.5),gender 和 content prompt 分别估调整量。所有 prompt 都要求输出 CTR-like 的量,直接当先验均值用,省掉一道校准。

先验均值 μ 转成 Beta 伪计数:α₀=1+round(κμ),β₀=1+round(κ(1−μ)),先验强度 κ=40。这个 40 是为让先验效果在稀疏流量下可观测而设的实验值,并非调参调出来的最优值;中位数评论 7 天曝光量是 12,75 分位约 40,κ=40 让先验在多数评论上保持影响力,等曝光到上四分位时行为证据能追上先验权重。后验每小时用 7 天滑动窗口的曝光和点击数更新:α=α₀+k(点击),β=β₀+n−k(曝光减点击)。展示时对每个候选评论采一个后验样本,取 Top-10。

结果

真实线上 A/B/C 测试,每个变体约 59.5 万用户,固定四周窗口(2026 年 3 月 7 日到 4 月 3 日)。A=均匀先验(对照),B=Gender Prior,C=Content Prior。

聚合层面结果平淡甚至有负:B 的 CTR +1.48%、CVR +1.23%,都不显著;C 的 CTR 反而显著降了 5.68%(p<0.001),CVR 方向性 +1.37% 但不显著。有意思的是两个先验作用在漏斗不同阶段:Gender Prior 偏即时点击,Content Prior 更偏下游转化(点开后真的去读)。

切片后才看出价值。按评论累计曝光量分桶,稀疏反馈区收益最大:

曝光桶Gender Prior CTR 提升Content Prior CTR 提升
0–9方向性正,不显著方向性正,不显著
10–49+9.51%(p<0.001)+7.76%(p<0.001)
50–199+6.72%(p<0.001)
200++3.07%(p<0.01)−4.16%(p<0.001)

先验与奖励的对齐上,gender 先验和观测 CTR 的正相关最清晰,base score 只有弱对齐,Content Prior 和 CTR 没有清晰单调关系。人群异质性很大:Gender Prior 的 CTR 增益集中在男性段,≤17 岁男性最强(+13.76%);女性段无显著 CTR 效果。Content Prior 对 18–37 岁女性 CTR 显著为负(−5.6%−9.3%),但对 28–37 岁女性 CVR +6.42%——同一种先验在不同人群甚至能拉出相反方向的效果。标题本身的吸引力能解释 22%51% 的评论 CTR 方差。

为什么重要

这篇对推荐系统工程的价值不在数字大小,而在模式:LLM 不必当独立的排序器或生成器,它可以只做离线语义先验估计器,暖启动一个在线 bandit,把昂贵的语义推理和低延迟线上服务解耦。这种「LLM 当先验、bandit 做决策」的分工,是把 LLM 塞进生产推荐栈的一个实用模板。

对从业者,冷启动先验设计是个真问题,尤其评论、UGC 这类文本本身就是信号的场景。但也要看清:聚合指标可能根本不动,增益藏在稀疏反馈和特定人群的切片里,上线前得想清楚怎么评估。

局限与存疑

作者列得很坦白。候选评论池是人工筛选过的(非原始全量),所以效果偏保守。评估绑定了一个特定的发现界面(评论和强标题视觉线索并列),换个界面未必成立。没做「分段后验 vs 池化后验」的直接消融,所以分段设计本身的因果贡献没被隔离。先验对齐对 CTR 清晰、对 CVR 弱。

还有几点存疑。κ=40 是为「让效果可观测」选的,不是生产最优,换流量环境结论可能变。Content Prior 聚合 CTR 显著为负却仍被部分肯定,靠的是 CVR 方向性正和不显著的结果,这个「正」很弱。最关键的是曝光集中度:两个 LLM 先验都比均匀先验展示更少的独特评论、把曝光集中在更小的集合上,这对需要新鲜感和轮换的轻浏览场景是实实在在的代价。

术语

原文与代码

社区讨论

相关论文

全部论文解读