Hamiltonian Spectral-Temporal Dissipative Dynamics for Sequential Recommendation
Shuiying Liao, P. Y. Mok
cs.IR
2026-08-26
HSR 把用户兴趣写成二阶耗散振子:位置是稳定偏好,动量是短期倾向。Beauty 上 Hit@10 到 0.0952、NDCG@10 到 0.0566,相对最强基线分别高出 1.82% 与 7.40%。
序列推荐从 GRU4Rec、SASRec 走到 Mamba4Rec,状态转移几乎都是一阶:下一个隐状态只看当前这个。用户行为里常见的惯性、周期性回流、看一眼就离开,一阶递推写不出来。论文举的例子是:连看几部动作片,被一条科幻预告带走,然后转回动作。一阶模型会跟着漂,人看到的是惯性、短暂偏离、再阻尼回来。
他们把偏好演化写成潜在相空间里的耗散哈密顿系统。位置 q 是稳定兴趣,动量 p 是短期倾向。质量、阻尼、刚度可学,外力来自物品曝光。
控制方程是带阻尼的受迫振子。时域逐步积分是 O(T²) 的,线性时不变所以改到频域:传递函数分母由 κ - mω² + i c ω 钉死,分子再放一个可学复数,FFT 一次就完成全局演化,复杂度 O(T log T)。动量不另学一条支路,而由位置谱乘 iω 再反变换,保证相空间自洽。
平滑轨迹解释不了日志里的突发点击,所以并行一条深度可分离时域卷积当局部冲量,再和谱位置门控融合。堆完 L 层之后,融合表示已经不是原始谱位置,于是在最后一层再做一次 RFFT 导数,把终端动量从同一条轨迹里取回来。预测不用终点位置,而是沿动量做一步欧拉外推:推荐的是用户正在去的地方,不是已经停过的地方。损失是全物品 softmax 加权重衰减。
三个数据集,leave-one-out。Amazon-Beauty:HSR Hit@10 0.0952、NDCG@10 0.0566、MRR@10 0.0448,相对当时最强的 DIFF 分别 +1.82%、+7.40%、+10.34%。Video-Games:0.1348 / 0.0753 / 0.0573,NDCG 相对 +10.57%。MovieLens-1M 更密,Hit@10 0.3255,略低于 HSTU 的 0.3268(-0.39%),NDCG@10 0.1907、MRR@10 0.1495 仍是最高,+2.36% / +4.25%。
消融里拿掉哈密顿块或局部冲量掉得最狠;去掉一步外推是小而稳定的下降,Video-Games 上更明显。Beauty 上 3 层块最好,Games 上 4 层,再深会掉,作者解释成过多变换把能量耗散掉。噪声注入 0% 到 30% 时,HSR 的下降曲线最平,阻尼在频谱上相当于低通。Beauty 上 4.74M 参数,相对 Mamba4Rec 的 6.07M 少约 22%;吞吐 60113 QPS 对 33945,单用户延迟 0.014 ms 对 0.025 ms。峰值显存 3.71 GB,高于 DIFF 的 1.74 GB。
一阶 SSM 已经能跑长序列。HSR 给了一个可解释的二阶先验:惯性、衰减、振荡分开写进 m、c、κ,下一步预测天然用速度。稀疏、短、吵的电商日志上,NDCG 和 MRR 的相对增益大于 Hit,说明它主要在把对的物品往更前面推。参数比 Mamba4Rec 和 DIFF 更少,训练 epoch 时间也更短。
MovieLens 的 Hit@10 没有全面压过 HSTU,二阶动力学不是密日志上的万能替换。
主表数字来自 leave-one-out 加有限候选之外的全排序设置,论文对负采样细节写得不多,和其他实现横比时要小心。MovieLens Hit@10 输给 HSTU,增益集中在稀疏集和排序指标。控制方程是线性时不变,非线性偏好跳变只靠局部卷积补,复杂季节性可能不够。物理参数可学,是否真对应「惯性」主要看分布对比:Beauty 阻尼更大、MovieLens 质量更大,这是事后解释,不是因果验证。没有线上 A/B。未来工作自己也写了:非线性势、自适应耗散、多模态还没做。