自然语言定义奖励轴,机器人偏好学习大幅提升
机器人强化学习长期受困于奖励函数设计:二元成败标注或轨迹偏好信号过于稀疏,难以支撑长时程任务。Marcel Torne 与 Chelsea Finn 团队等提出 freeform preference learning,用自然语言定义奖励轴,让人类可用自由文本描述偏好。在 RoboPapers 播客介绍的 arXiv 论文中,该方法在机器人操作任务上带来约 38 个百分点的性能提升,为破解奖励设计难题提供了新思路。
2026-09-09 ~ 2026-09-10 · 2 条相关
- 自由格式偏好学习:用自然语言定义奖励轴破解机器人 RL 难题 — chris_j_paxton · 2026-09-09
- Freeform 偏好学习:自然语言轴定义奖励,机器人操作任务提升 38 个百分点 — StanfordAILab · 2026-09-10