MIT 提出 SOLE-R1:视频语言推理充当唯一奖励,机器人零样本在线学技能

micoolcho · x · 2026-10-08

MIT 与 RAI Institute 发布论文 SOLE-R1:Video-Language Reasoning as the Sole Reward for On-Robot RL(代码、模型、数据均已开源)。

问题:用 VLM 当强化学习的评估器时,现有最强模型在部分可观测与分布偏移下经常出错,导致策略钻感知错误的空子而非真正完成任务。

方法:SOLE-R1 是专门设计来充当在线 RL 唯一奖励信号的视频语言推理模型——仅凭原始视频和自然语言目标,逐步进行时空链式推理(CoT),输出稠密的任务进度估计直接作为奖励。训练上构建了大规模视频轨迹与推理合成管线,生成时间对齐的 CoT 轨迹与连续进度监督,采用 SFT + 可验证奖励 RL 的混合框架。

结果:在 4 个仿真环境和真机上,SOLE-R1 实现从随机初始化出发的零样本在线 RL——机器人在没有真值奖励、成功指示、演示或任务特定调参的情况下,学会 24 个未见过的操作任务。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →