自然语言定义奖励轴,机器人偏好学习大幅提升

机器人强化学习长期受困于奖励函数设计:二元成败标注或轨迹偏好信号过于稀疏,难以支撑长时程任务。Marcel Torne 与 Chelsea Finn 团队等提出 freeform preference learning,用自然语言定义奖励轴,让人类可用自由文本描述偏好。在 RoboPapers 播客介绍的 arXiv 论文中,该方法在机器人操作任务上带来约 38 个百分点的性能提升,为破解奖励设计难题提供了新思路。

2026-09-09 ~ 2026-09-10 · 2 条相关