Meta 提出 AIMS 方法:让 LLM 推荐器在历史偏好与当前指令冲突时听用户的话
_reachsumit · x · 2026-10-05
Meta 团队的 arXiv 论文(2610.02600)研究指令引导的生成式推荐:当用户历史交互偏好与当前请求冲突时,历史事件常会压过请求本身。作者指出把单个历史事件的影响转成监督信号有两个障碍——影响最大的事件未必支持目标物品;删除误导性事件虽会提高目标分数,但可能让竞品分数涨得更多,排名反而更差。提出的 AIMS(非对称指令引导边际监督)用冻结参考模型找出"删除后同时提升目标分数和竞争边际"的事件,将删除效应转化为排序监督目标。Meta 用此训练 LLM 推荐器优先遵循当前请求。
「研究」频道最新
- 训练进执行 harness,Qwen3-14B 在 Spider 2.0 从 22.2% 飙到 54.8% — omarsar0 · 2026-10-11
- REMAG 发布:磁性材料 DFT 计算 GPU 化,特定化合物提速达 111 倍 — CatAstro_Piyush · 2026-10-11
- Yoav Goldberg 炮轰 COLM: RL 损失微调算不上科学 — yoavgo · 2026-10-11
- 斯坦福研究:Agent 循环卡顿改 harness,计划差就得训权重 — rohanpaul_ai · 2026-10-11
- 哈佛医学院 ToolUniverse 工作坊:给 AI 配 2700 个科学工具造 AI 科学家 — marinkazitnik · 2026-10-11
- Mark Tenenholtz:RLVR 易得红利枯竭,「品味」类任务成下一前沿 — marktenenholtz · 2026-10-11