按注意力头合并模型,把 LLM 推荐系统的推理链砍短 24%

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu

cs.IR, cs.AI

2026-08-11

把慢思考和快思考推荐模型按注意力头分别赋权合并,推理链最多缩短 24.3%,评分准确率不降反升。

这篇在解决什么

用大模型做推荐有两套打法。慢思考模型(slow-thinking)会一步步写出推理过程再给评分,准确但啰嗦,每个预测要吐两三百 token;快思考模型(fast-thinking)直接给分,便宜但差一点。工业上想要的是两者的中间态:保留慢思考的准确,砍掉冗长的推理链。

已有的压缩办法要么重新训练模型(成本高),要么在推理时硬卡 token 预算或下指令让它说短点(脆弱、不好规模化)。这篇走的是模型合并(model merging)这条路:把快慢两个模型的参数在同一个空间里融合,免训练。

方法

常规的模型合并给整层、整模型一个统一的融合系数。REAM 把粒度下放到单个注意力头(attention head)。作者发现推理行为集中在一小撮头上,Transformer 里每个头分工不同,所以按头分别赋权更合理。

每个头拿一个独立系数,系数由三个信号决定:

三个信号合成一个受约束的优化问题,解出来的系数是注水(water-filling)形式:对推理贡献大、又对改动不敏感的头少动,其余的多注入快思考的简洁行为。

结果

在 Amazon Book、Music、Yelp 三个数据集上(Qwen2.5-3B-Instruct 为底座,慢思考用 RecZero、快思考用 TALLRec):

数据集推理长度降幅MAERMSE
Book24.3%0.63380.9116
Music21.1%0.53480.8324
Yelp17.9%0.75641.0649

推理链短了,准确率没掉还略涨:Book 的 MAE 从 RecZero 的 0.6650 降到 0.6338。因果验证里,把最关键的前 5% 的头消融掉,KL/JSD 散度涨了 3.29 到 11.57 倍,远超随机消融,说明这三个信号确实定位到了推理的核心。

为什么重要

模型合并是个免训练、加完即用的方向,这篇把合并粒度做到注意力头级别是个实在的进步。对推荐系统的从业者,这意味着不用重训就能让慢思考推荐模型更便宜地部署。注意力头级别的合并思路本身不绑死推荐场景,对其它「想融合两个不同行为模型」的问题也成立。

局限与存疑

作者自己承认,模型放大到 Qwen2.5-7B 后,REAM 的 MAE(0.7910)还是不如纯慢思考(0.7626),这套选择性合并在更大模型上没完全补上准确率差距。实验只在推荐评分预测(MAE/RMSE)上做,没有 Top-K 召回这类更常见的推荐指标。三个关键性信号的计算本身需要一份校准集,多了一道工序。

术语

原文与代码

社区讨论

相关论文

全部论文解读