LLM 推荐的显式推理太贵,HiLaR 用分层隐式状态替代,4 个数据集 3 个最优

Hierarchical Latent Reasoning for LLM-based Recommendation

Peiyu Hu, Siying Gu, Weihai Lu, Zhuodong Liu, Yuntian Tang, Jiahao Liang, Yiying Xie, Jiang Rong, Zhaokai Luo, Zhiyong Wang, Jia Wang

cs.IR, cs.AI

2026-07-30

显式 CoT 推理让 LLM 推荐延迟高,HiLaR 改用由粗到细的分层隐式状态配层感知 GRPO,Amazon 四个数据集小幅领先。

这篇在解决什么

让大模型做推荐,一个流行思路是给它加推理(Chain-of-Thought,显式地在自然语言里一步步想)。问题是这些推理 token 在推理时开销很大,延迟和显存都吃紧。退一步用「隐式推理」(latent reasoning,在隐空间里做几步中间状态而不生成文字)能省开销,但现有做法把每个隐式状态当成同质的细化步骤,没有区分它们各自的职责。作者观察到,不同层的隐式状态对生成目标物品的贡献在统计上是显著不同的(p<0.05),而最终推荐奖励只给整条轨迹一个反馈,没法定位到具体哪一步贡献了多少。

方法

HiLaR(Hierarchical Latent Reasoning)把隐式推理状态组织成一条由粗到细的层级,三块组成。

第一块是「时间引导的分层量化」。用残差向量量化(RVQ),设 K=4 个共享码本,逐级把上一级解释掉的成分从残差里拿掉。同时把用户历史按时间切成 K 个有序窗口(从早到近),让每一级的监督逐步收窄:第一级代表整体历史偏好,后面的级越来越聚焦近期行为和目标物品。

第二块是「分层隐式对齐微调」,把每个隐式推理状态和对应的量化表示对齐,联合优化推荐生成和这种分层对齐。

第三块是「分层奖励引导的 GRPO」。每个用户采 G=6 条 rollout,隐式状态做高斯扰动。关键创新是「层感知过程奖励」:用加上第 k 个隐式状态前后、目标物品对数概率的差 Δ₉,ₖ = ℓ₉,ₖ − ℓ₉,ₖ₋₁ 来量化每一级的边际增益,作为稠密的过程奖励,再和最终奖励(精确匹配、前缀相似度、F1、协同偏好)合起来。为什么要这样设计:时间层级给了一条从粗到细的归纳偏置,层感知边际增益直接量化每一步对目标的贡献,补上了最终奖励太稀疏的缺口。

结果

骨干 Qwen2.5-1.5B,四个 Amazon 数据集:

数据集指标最强基线(FLR)HiLaR
ToysH@100.11620.1213
GamesH@100.10410.1075
InstrumentsH@100.13020.1320
CDsH@100.14540.1484

提升幅度在 1.4% 到 4.4% 之间,四个数据集里三个在多数指标上最优(CDs 上有个别指标被 VRec 反超)。消融显示,去掉时间量化的掉点最大,去掉分层对齐次之,去掉 GRPO 也明显退化,说明三块都起作用。隐式状态分析显示,HiLaR 每层的增益比 LatentR3、VRec 更分化,而且用户历史越长、增益越大。

为什么重要

「显式推理效果好但太贵、隐式推理便宜但欠监督」是 LLM 推荐的一个真实两难。这篇给出的答案是:给隐式状态强加一个由粗到细的层级结构,再用层感知的稠密奖励把每一步的贡献算清楚。对做 LLM 推理效率的人,「把 CoT 的多步结构搬到隐空间、并按层分配监督」是个可参考的方向。要诚实地说,绝对提升是渐进的(个位数百分点),更适合理解成在 latent reasoning 这条线上的一次结构改进,而不是一个飞跃。

局限与存疑

作者承认几个口径:骨干固定在 Qwen2.5-1.5B,预处理沿用 LatentR3;效率对比里说 HiLaR 有「中等」开销、CoT 高得多,但没给具体的延迟和显存数字,这个对比偏定性。另有两点:提升幅度本身不大,在 CDs 上还被对手反超过,稳健性需要更多数据集支撑;K=4 这个层级数怎么选、对结果有多敏感,文中也着墨不多。

术语

原文与代码

社区讨论

相关论文

全部论文解读