MIT 提出 SOLE-R1:视频语言推理充当唯一奖励,机器人零样本在线学技能
micoolcho · x · 2026-10-08
MIT 与 RAI Institute 发布论文 SOLE-R1:Video-Language Reasoning as the Sole Reward for On-Robot RL(代码、模型、数据均已开源)。
问题:用 VLM 当强化学习的评估器时,现有最强模型在部分可观测与分布偏移下经常出错,导致策略钻感知错误的空子而非真正完成任务。
方法:SOLE-R1 是专门设计来充当在线 RL 唯一奖励信号的视频语言推理模型——仅凭原始视频和自然语言目标,逐步进行时空链式推理(CoT),输出稠密的任务进度估计直接作为奖励。训练上构建了大规模视频轨迹与推理合成管线,生成时间对齐的 CoT 轨迹与连续进度监督,采用 SFT + 可验证奖励 RL 的混合框架。
结果:在 4 个仿真环境和真机上,SOLE-R1 实现从随机初始化出发的零样本在线 RL——机器人在没有真值奖励、成功指示、演示或任务特定调参的情况下,学会 24 个未见过的操作任务。
「具身」频道最新
- AgenticROS 让 AI 智能体直接操控真实机器人,深度感知成 Physical AI 基建 — chrismatthieu · 2026-10-08
- 机器人公司跨界拍 MV:人形机器人出镜音乐视频走红 — adityaag · 2026-10-08
- VC 热钱与人才涌入机器人,机器人学家为何是文艺复兴式通才 — lukas_m_ziegler · 2026-10-07
- PhD 毕业生求职:EMPIRIC 残差世界模型收官博士论文系列 — tomssilver · 2026-10-07
- 「戴上脑机接口,像中国量化交易员一样工作」 — alexbilz · 2026-10-07
- 从业者质疑 1X Neo 交付进度:未见真实部署,Agility 跌出前十 — jonstephens85 · 2026-10-07