Meta 提出 AIMS 方法:让 LLM 推荐器在历史偏好与当前指令冲突时听用户的话

_reachsumit · x · 2026-10-05

Meta 团队的 arXiv 论文(2610.02600)研究指令引导的生成式推荐:当用户历史交互偏好与当前请求冲突时,历史事件常会压过请求本身。作者指出把单个历史事件的影响转成监督信号有两个障碍——影响最大的事件未必支持目标物品;删除误导性事件虽会提高目标分数,但可能让竞品分数涨得更多,排名反而更差。提出的 AIMS(非对称指令引导边际监督)用冻结参考模型找出"删除后同时提升目标分数和竞争边际"的事件,将删除效应转化为排序监督目标。Meta 用此训练 LLM 推荐器优先遵循当前请求。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →