When History Misleads: Asymmetric Margin Supervision for Instruction-Guided LLM Generative Recommendation
Ming Yin, Yuhan Yang, Chen Chen, Xinyu Lin, Wentao Shi, Fangcong Yin, Chaofei Yang, Chao Yang, Jiyan Yang, Hui Zhang, Ning Jiang, Yiran Chen, Qifan Wang
cs.IR
2026-10-02
AIMS用合格的单事件删除,给目标相对边界竞品定一条间隔,训练和推理仍读完整历史。六个LLM、三个数据集上,Recall@10比继续交叉熵相对高4.0%到10.9%。
指令引导的生成式推荐要同时读当前自然语言请求和交互历史。请求本该规定现在能推什么,历史只在合格物品里做个性化。冲突时历史会盖过去。刚看过红烧排骨视频的用户要一份30分钟内的素食晚餐,三小时牛肉炖菜会排到20分钟鹰嘴豆意面前面。
该删哪条,冻结推荐器回答不了。影响用完整历史与遮掉该事件后、首个物品码分布的Jensen-Shannon散度(两个分布有多不一样)来量,这个量不带方向。1600条工业训练请求、47972条事件上,Llama-3.1-8B与Gemma-3-12B的影响和效用绝对值相关为0.300、0.167,和带符号效用只有0.045、0.002。挑影响最大的事件,比历史内均匀抽取只多0.24和0.42个百分点的目标支持,95%区间含0。去掉具体意图后,效用符号不一致率比保意改写高17.10和4.65个百分点。
目标分变高也不等于名次变好。初始未进top-10的请求上,删掉目标分提升最大的事件后,11.8%(Llama)和16.7%(Gemma)的间隔变窄,因为边界竞品升得更多。重新解码只挽回1.08%和1.50%。
AIMS(Asymmetric Intervention-Guided Margin Supervision)用删除来制造监督。学生读到的仍是完整历史,推理就是原解码器,不做删除搜索。
物品编成SID(semantic identifier,由内容得到的三个离散码),每层词表2048。分数是三个token对数概率之和。工业日志用束宽100扫全库。Qilin和KuaiSearch-Lite在候选池上按同一分数排序。
冻结的监督微调(SFT)检查点同时当参考模型和学生的初值。保护集只收目标已在top-10的训练请求,竞品锁在第11名。参考模型对每条历史做单事件删除。删除要同时抬高目标分和与第11名的间隔,幅度都超过10⁻⁴ nat(自然对数单位),才留下增益最大的一次,加到原间隔上,称为反事实间隔。没有合格删除则增益为0,请求仍留在保护集。Llama与Gemma的保护集占训练请求18.1%和30.6%,其中88.2%和85.7%有合格删除,正增益中位数0.234和0.256 nat。
交叉熵覆盖全部训练请求。辅助铰链只加在保护集:完整历史上的间隔若比反事实间隔低过0.01 nat就罚,权重为1。目标分用停止梯度摘掉,只决定罚不罚,反传只压竞品。删到三个事件,或对五个竞品取平均,Recall@10几乎不动,参考模型的打分视图最多到2.9倍。默认因此停在一条删除、一个竞品。
六个骨干从同一SFT检查点接着训:Llama-3.1-8B/70B、Gemma-3-4B/12B、Qwen3-8B/14B。对照是步数对齐的继续交叉熵Continued CE,以及CFT、LETTER(RG)、LTRGR、S-DPO。三个数据集上AIMS的Recall@10和NDCG@10都是第一。相对Continued CE,Recall@10相对提升4.0%到10.9%,每个设置都涨。一万次用户聚类bootstrap下,对最强基线的Recall@10都显著(p<0.05)。
| 设置 | Continued CE | AIMS |
| 工业全库 Llama-3.1-8B Recall@10 | 6.902% | 7.223% |
| 工业全库 Gemma-3-12B Recall@10 | 7.945% | 8.609% |
| 同上两模型 NDCG@10 | 4.460% / 5.141% | 4.629% / 5.598% |
| Qilin上 Llama-8B / 70B Recall@10 | 35.48% / 43.47% | 37.61% / 45.62% |
| KuaiSearch-Lite上 Qwen3-8B Recall@10 | 23.94% | 26.56% |
工业全库的绝对Recall@10大约在7%到9%。Llama-3.1-8B与Gemma-3-12B的三种子均值相对LETTER只多0.095±0.058和0.083±0.027个百分点,三次都更高。10.9%的相对上沿来自KuaiSearch-Lite的Qwen3-8B。
消融数字是工业集上的Llama / Gemma。去掉删除增益、只给初始间隔设地板的R-comp,仍比Continued CE高0.093和0.336个百分点,增益本身占掉AIMS改进的71%和49%。按最大目标提升或最大影响选删除,合格率只有75.9/66.1%和28.8/25.9%,AIMS是88.2/85.7%,Recall@10从7.223%/8.609%降到7.091%/8.426%和7.063%/8.312%。把删过的历史当训练输入,纯交叉熵赢不了Continued CE。辅助梯度只走目标,则和Continued CE持平。
留存和挽回一起升。Llama留存从94.73%到96.28%,挽回从0.595%到0.828%。Gemma留存从92.84%到94.12%,挽回从0.863%到1.475%。挽回贡献了总增益的68%和85%,尽管辅助损失只加在训练时已经排对的请求上。至少一半可判定历史违反品类约束时,Recall@10多涨0.558和0.874个百分点,全测试集是0.321和0.664。前十个槽的确认违规率从29.0/25.4%降到21.6/18.3%。选中的删除有80.9/83.8%打在违规事件上,高出历史构成期望16.8和16.6个百分点。改用泛化请求来选,超出只剩2.9和4.1。
以0.5的概率丢掉训练历史,Recall@10比AIMS低0.176和0.378个百分点。换成其他用户的匹配历史,AIMS和Continued CE掉点接近。
推理不用改,也不做删除搜索。额外成本在训练前:参考模型给保护集打单事件删除的分,大约每条30个视图,缓存之后固定。
训练目标和前面的测量对齐。请求专属间隔,加上梯度只压竞品,就是这两条测量逼出来的做法。工业全库上,这两个骨干相对LETTER的三种子优势不到0.1个百分点。这是渐进改进,SID检索没有换一套。
盯住的是固定的第11名,只是成对代理。top-10还取决于其他候选和束搜索,间隔变窄时目标仍可能进列表。
冲突分层是观察结果。增益随冲突加重而上升,不能据此把冲突当成原因。违规统计只覆盖工业测试里大约25%、能解析出显式正品类的请求。30分钟、素食这类更细的条件没有同样的数字。点击目标自己违规时,删除打中违规历史的比例比期望低12.3和11.1个百分点。优化点击和遵守指令会岔开。
候选不足40个时,池子用无点击标签的训练曝光补齐,公开集的绝对Recall不能和工业全库比。全库数字来自匿名生产日志,论文没有给出公开数据入口。辅助损失在两个消融骨干上只盖住训练集的18%到31%。没命中请求的改善是间接的。