Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging
Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu
cs.IR, cs.AI
2026-08-11
把慢思考和快思考推荐模型按注意力头分别赋权合并,推理链最多缩短 24.3%,评分准确率不降反升。
用大模型做推荐有两套打法。慢思考模型(slow-thinking)会一步步写出推理过程再给评分,准确但啰嗦,每个预测要吐两三百 token;快思考模型(fast-thinking)直接给分,便宜但差一点。工业上想要的是两者的中间态:保留慢思考的准确,砍掉冗长的推理链。
已有的压缩办法要么重新训练模型(成本高),要么在推理时硬卡 token 预算或下指令让它说短点(脆弱、不好规模化)。这篇走的是模型合并(model merging)这条路:把快慢两个模型的参数在同一个空间里融合,免训练。
常规的模型合并给整层、整模型一个统一的融合系数。REAM 把粒度下放到单个注意力头(attention head)。作者发现推理行为集中在一小撮头上,Transformer 里每个头分工不同,所以按头分别赋权更合理。
每个头拿一个独立系数,系数由三个信号决定:
三个信号合成一个受约束的优化问题,解出来的系数是注水(water-filling)形式:对推理贡献大、又对改动不敏感的头少动,其余的多注入快思考的简洁行为。
在 Amazon Book、Music、Yelp 三个数据集上(Qwen2.5-3B-Instruct 为底座,慢思考用 RecZero、快思考用 TALLRec):
| 数据集 | 推理长度降幅 | MAE | RMSE |
| Book | 24.3% | 0.6338 | 0.9116 |
| Music | 21.1% | 0.5348 | 0.8324 |
| Yelp | 17.9% | 0.7564 | 1.0649 |
推理链短了,准确率没掉还略涨:Book 的 MAE 从 RecZero 的 0.6650 降到 0.6338。因果验证里,把最关键的前 5% 的头消融掉,KL/JSD 散度涨了 3.29 到 11.57 倍,远超随机消融,说明这三个信号确实定位到了推理的核心。
模型合并是个免训练、加完即用的方向,这篇把合并粒度做到注意力头级别是个实在的进步。对推荐系统的从业者,这意味着不用重训就能让慢思考推荐模型更便宜地部署。注意力头级别的合并思路本身不绑死推荐场景,对其它「想融合两个不同行为模型」的问题也成立。
作者自己承认,模型放大到 Qwen2.5-7B 后,REAM 的 MAE(0.7910)还是不如纯慢思考(0.7626),这套选择性合并在更大模型上没完全补上准确率差距。实验只在推荐评分预测(MAE/RMSE)上做,没有 Top-K 召回这类更常见的推荐指标。三个关键性信号的计算本身需要一份校准集,多了一道工序。