ReCouPLe 用语言理由做几何约束,奖励模型分布偏移下精度提升1.5倍
burny_tech · x · 2026-09-21
ICLR26 论文《Causally Robust Reward Learning from Reason-Augmented Preference Feedback》(arXiv:2603.04861,Hwang 等,UPenn 团队)针对偏好学习的基础缺陷:二值判断「轨迹 A 优于 B」不说明为何更好,奖励模型可能学到偶然相关性——比如真实偏好是避撞,模型却学到「往左移」是对的。
方法:ReCouPLe 把自然语言理由作为几何约束嵌入。每条 rationale(如「避免碰撞」「更快完成任务」)被嵌入为一个方向向量 ψ,将轨迹表征 φ(τ) 分解为沿该方向的平行分量与正交残差,迫使偏好由与理由对齐的特征解释,而非无关上下文。
关键性质:相同语义的理由(如避撞)可跨任务复用同一因果方向,无需额外数据或微调即可把偏好知识迁移到新任务。
结果:分布偏移下奖励精度最高提升 1.5 倍,新任务上下游策略性能约 2 倍于基线;代码已开源。
「编程与Agent」频道最新
- 博主预告开源 Obsidian Agent 插件与一键部署网站系统 — vista8 · 2026-09-21
- JEV 实测:证据不足时 IDK 选项 80 次全败 — iamrobotbear · 2026-09-21
- 开源项目 Repowise 走红:为 AI Agent 索引代码库拿 6.7k 星 — tom_doerr · 2026-09-21
- 逆向拆解 Jev:架构哲学与适用边界一次讲清 — iamrobotbear · 2026-09-21
- AI 两小时做出完整 MMO,资深程序员追问:技能不再被需要怎么办 — devontec · 2026-09-21
- 向智能体下指令新姿势:用 ChatGPT 听写口述需求再粘贴 — athyuttamre · 2026-09-21