自由格式偏好学习:用自然语言定义奖励轴破解机器人 RL 难题

chris_j_paxton · x · 2026-09-09

机器人强化学习中最难的环节之一是奖励函数设计:二元的成败标注或轨迹偏好选择信号太稀疏,难以支撑长时程任务。

Marcel Torne 等人提出 freeform preference learning:

作者与 Michal Cho 等在 RoboPapers 播客中详细介绍了该方法。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →