Recommender System as Slow and Fast Thinkers
Zichen Yuan, Xiaoxuan Dong, Linkun Dai, Jinwei Yang, Jining Luan, Dexu Yu, Chunxiao Li, Joemon M. Jose, Youhua Li, Hanwen Du, Junchen Fu
cs.IR
2026-09-02
静态序列推荐对长历史和冷门用户掉点超过 20%。DS-Frame 用选择器按预算把样本分给一跳 Fast 或 K 步隐状态精炼,SASRec 平均 NDCG@10 相对 +7.5%,难用户 +8.4%。
序列推荐上线后,每条用户序列走同一张计算图、花同样的算力。短历史、主流兴趣往往一跳就够;长历史、口味混杂或偏冷门时,一跳可能分不开竞争兴趣。问题不只是「有人更难猜」,而是静态推理不管多算一步有没有用,都付一样的钱。
作者按交互长度和历史物品流行度切用户。SASRec / BERT4Rec 在「普通环境」明显强于「困难环境」:长度切分下 NDCG@10 相对掉 22.0% 和 20.6%,困难组只占用户的 13.8%;流行度两端各 20% 时相对掉 14.7% 和 13.7%。
DS-Frame 是可插拔的快慢推理。共享 Transformer 编码器给出用户表示。Fast 就是原 backbone 的一跳预测。Slow 在完整隐序列上做 K 步精炼:每步把一个带步嵌入的 reasoning token 拼到序列上,共享参数的推理块更新,取最后一个 token 当新表示。训练时对每一步做下一物品监督,邻步分布加 KL 连续项,温度按步退火,最终把各步 logits 平均。
选择器是两层 MLP,输出走 Slow 的概率。训练时两边都跑,用「损失 + 归一化代价」更低的那边当 oracle 标签;Fast 代价为 1,Slow 为 1+γK,默认 γ=1。再加一个预算项,把 mini-batch 平均激活率拉向目标 b。推理时只看门控分数和阈值,看不到标签。K 在 {1,2,3} 里搜,Beauty 上报的设置是 K=2、约 40% 走 Slow。
五个数据集:Yelp 和 Amazon 2023 的 Video Games、Beauty、Sports、Toys。全库排序,不是采样负例。序列截断到 50。
挂上 DS-Frame 后,SASRec 平均相对提升 NDCG@10 / NDCG@20 / HR@10 / HR@20 为 7.5%、6.6%、6.6%、6.2%;BERT4Rec 为 6.7%、6.3%、6.0%、5.9%。Beauty 上 SASRec 的 NDCG@10 从 0.0418 到 0.0453(+8.4%)。统一 SASRec 骨干时,平均 NDCG 相对基线:STREAM +5.2%,ReaRec-PRL +7.2%,DS-Frame +7.5%,LARES +7.3%,ManCAR +7.6%。和最强单路精炼基本打平,卖点不在绝对值。
长度切分下增益不均:SASRec 普通用户 +3.3%(Slow 激活 24.8%),困难用户 +8.4%(58.6%);BERT4Rec 为 +3.2% / +8.5%。Beauty 路由对照:
| 策略 | NDCG@10 | Slow 激活 | 相对代价(K=2) |
| 只用 Fast | 0.0418 | 0% | 1.00× |
| 只用 Slow | 0.0431 | 100% | 3.00× |
| 随机 40% | 0.0438 | 40% | 1.80× |
| 学习选择器 | 0.0453 | 40.2% | 1.80× |
| oracle | 0.0461 | 40% | 1.80× |
40%–60% 预算的学习路由已经超过「全部走 Slow」。选择器在没有标签的情况下接近 oracle。
对已经在用 SASRec / BERT4Rec 的团队,这是在推理侧加条件计算,不换骨干。算力应该给边际收益高的样本:困难组 Slow 比 Fast 的 NDCG 缺口是普通组的约四倍,激活率也对得上。一律多想几步既贵又更差,说明 Slow 不是严格更强的模型,是一种该挑着用的精炼。
和 ReaRec、LARES、ManCAR 的差别是粒度:那些方法在一条推理模块里决定何时停,DS-Frame 先保留 backbone 一跳,再学要不要付固定的 K 步。
没有单独的局限节。序列截到 50,长度切分定义的「长历史」被人工封顶,和真实超长行为不是一回事。只挂了两个骨干,图模型和对比学习系列没测。全是学术点击日志,没有延迟 SLA 下的线上 A/B。训练 oracle 用了标签,和线上门控有分布差;学习器相对 oracle 仍有缺口(0.0453 vs 0.0461)。流行度切分明确不是去偏方法。困难组只占 13.8%,总盘 7.5% 大部分仍来自普通用户的小涨。ManCAR 平均还略高,自适应快慢不是质量上限。