From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation
Zhi Chen, Minmao Wang, Xingchen Liu, Haoqiang Liang, Huihuang Lin, Likang Wu, Hongke Zhao, Yulong Wang, Shijie Yi, Fei Pan, Peng Jiang
cs.IR
2026-07-30
LLM 推理合理却缺推荐反馈,快手区分意图与策略、用语义相似度当稠密奖励发现策略,蒸馏进轻量生成器,线上收入 +4.506%。
生成式推荐里,大模型能读用户杂乱的交互历史、推理出他当下想要什么,听起来是个好帮手。但大模型训练时并没有见过「推荐结果好不好」这种反馈,所以它给出的「语言上说得通」的推理,未必导向一个好的推荐决策。作者把这种错位叫 Understanding-Action Gap(理解-行动鸿沟)。
他们进一步把推荐该用到的知识分成两种。一种是意图知识(intent knowledge),刻画用户当下想要什么,比如从「网球拍、球、鞋」推断出他在「凑齐一套网球装备」。另一种是策略知识(policy knowledge),指在这种意图下该怎么推:推荐方向是什么、拒绝边界在哪。在「网球配件」这个意图一致的范围内,还有一堆语义上都合理的候选(网球帽 vs 球拍包),到底推哪个,要靠结果反馈来定,光靠语言推理定不了。现有的 LLM 增强推荐大多止步于意图建模,没拿到结果反馈,所以算不上真正的策略知识。
框架分三步,目标是最终做到「线上推理不用 LLM」。
第一步,意图归纳。一个 LLM 意图 agent 读交互历史和物品元数据,生成文本意图,用冻结的语义编码器编成教师表示。
第二步,反馈驱动的策略发现。一个策略 agent 看历史「前缀-后继」的转移,生成 K=5 条个性化的策略假设,每条说清推荐方向和拒绝边界。怎么验证哪条好?用一个固定的执行器分别跑「只给意图」和「给意图加某条策略」两种预测,用两者输出与真实目标在语义空间的余弦相似度之差当优势 A。作者特别说明用语义相似度做稠密的策略级奖励,是因为 Recall@K、NDCG@K 这种排名指标太稀疏,撑不起迭代式的策略打磨。一个反馈 agent 综合看这一组证据、发现规律,策略最多迭代 R=2 轮,只保留相对纯意图有正收益的策略。
第三步,双空间关系蒸馏。线上不能跑大模型,得把知识搬到一个轻量的 SID 生成器里。在 SID 生成前加两个隐 token(意图、策略),形成「理解-规划-生成」。蒸馏不是直接对齐 embedding,而是对齐用户之间的一阶关系和更高阶的邻域结构(用 KL 散度)。
离线在 Amazon 上,TIGER 骨干、Beauty 数据集:R@5 从 0.0425 到 0.0491(+15.5%),R@10 从 0.0617 到 0.0739(+19.8%),N@10 从 0.0333 到 0.0417(+25.2%);LETTER 骨干也有类似提升。相比直接用 Qwen3.5-122B 推理,这套方法在各项指标上都更好。
线上 A/B(快手,7 天,约 1325 万用户、161 万物品、约 7000 万交互样本):收入 +4.506%,ADVV(广告主价值)+4.621%,都在 95% 置信水平显著。
效率是这套设计的卖点之一:基础模型每样本 0.023 秒,加意图和策略两个 token 到 0.032 秒,而直接用大模型推理要 4.437 秒(慢约 137 倍)。消融也讲清了贡献:意图在 SID 第一级提升最大(把目标定到正确的语义区),策略在更深层贡献更大(细粒度区分物品);蒸馏里去掉高阶关系、去掉意图或策略,都会掉点。
「LLM 推理合理但不一定转化为好推荐」是 LLM 加推荐落地时很普遍的隐患,这篇把它形式化成理解-行动鸿沟,并给了一条可工程化的解法:把策略知识从轨迹里挖出来、用稠密奖励验证、再蒸馏掉大模型。对工业推荐团队,「线上 LLM-free、训练时用 LLM 当教师」这个范式兼顾了效果和延迟,而且有真实的大规模 A/B 背书。意图和策略的拆分也是个清晰的建模抽象,可以独立借鉴。
策略发现和迭代只发生在训练交互上,验证集和测试集目标从不参与策略生成、评估或打磨;没有正优势候选的用户被排除在教师侧蒸馏之外,这部分人的覆盖没讨论。策略迭代实际只跑了 R=2 轮,更多轮的收益和成本没有给出曲线。线上只报了收入和 ADVV 两个商业指标,用户侧体验指标(多样性、novelty)缺失。另有一点:1325 万用户的 A/B 很扎实,但「语义相似度当奖励」本身依赖编码器质量,这个奖励有偏会直接传导到策略选择,文中对奖励鲁棒性的讨论偏少。