Freeform 偏好学习:自然语言轴定义奖励,机器人操作任务提升 38 个百分点
StanfordAILab · x · 2026-09-10
Chelsea Finn 团队等在 RoboPapers 播客介绍了 arXiv 论文《Freeform Preference Learning for Robotic Manipulation》(FPL)。
- 问题:奖励设计是机器人策略改进的核心瓶颈——稀疏奖励信号太少,二元偏好学习又把多个质量维度压成一个模糊信号,学习效率低。
- 方法:FPL 让标注者用自然语言定义偏好轴(如速度、安全、放置质量、精细度),在每条轴上做成对比较;再用这些标注训练语言条件化的奖励模型,进而训练奖励条件化的策略。
- 结果:在 4 个真实世界和 2 个仿真长时程操作任务上,FPL 比稀疏奖励和二元偏好方法提升 38 个百分点;无需显式子任务切分即可学到稠密进度信号,表现出数据中不存在的组合性行为,且测试时可不重训切换行为方向。
所属事件:自然语言定义奖励轴,机器人偏好学习大幅提升(2 条相关)→
「具身」频道最新
- 宇树全面开源 6B 人形机器人基础模型 UnifoLM-WLA-1.0 — teortaxesTex · 2026-09-10
- 爆料称特斯拉把资源押向 Robotaxi,今年或投放数千辆 — FuSheng_0306 · 2026-09-10
- 开源机器人仿真器 Webots:4.6k 星,可仿真机器人与车辆 — tom_doerr · 2026-09-10
- 马德里将成欧洲首个自动驾驶出租车城市,加州牌照车已上路 — eherrerosj · 2026-09-10
- Dexory 仓储机器人每日自动盘点,替代人工巡库 — lukas_m_ziegler · 2026-09-10
- DexGPT 开源:GPT 从一段手部视频自动写出 real2sim 流水线 — animesh_garg · 2026-09-10