ReCouPLe 用语言理由做几何约束,奖励模型分布偏移下精度提升1.5倍

burny_tech · x · 2026-09-21

ICLR26 论文《Causally Robust Reward Learning from Reason-Augmented Preference Feedback》(arXiv:2603.04861,Hwang 等,UPenn 团队)针对偏好学习的基础缺陷:二值判断「轨迹 A 优于 B」不说明为何更好,奖励模型可能学到偶然相关性——比如真实偏好是避撞,模型却学到「往左移」是对的。

方法:ReCouPLe 把自然语言理由作为几何约束嵌入。每条 rationale(如「避免碰撞」「更快完成任务」)被嵌入为一个方向向量 ψ,将轨迹表征 φ(τ) 分解为沿该方向的平行分量与正交残差,迫使偏好由与理由对齐的特征解释,而非无关上下文。

关键性质:相同语义的理由(如避撞)可跨任务复用同一因果方向,无需额外数据或微调即可把偏好知识迁移到新任务。

结果:分布偏移下奖励精度最高提升 1.5 倍,新任务上下游策略性能约 2 倍于基线;代码已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →