SOLE-R1:用视频语言推理作唯一奖励,机器人零样本在线 RL 登 NeurIPS
micoolcho · x · 2026-10-09
MIT 与 RAI Institute 的论文 SOLE-R1(将被 NeurIPS 2026 收录)提出用视频-语言推理模型作为在线强化学习的唯一奖励信号。要点:
- 问题:VLM 作 RL 评估器时,在部分可观测与分布偏移下容易失效,策略会利用感知错误而非真正完成任务。
- 方法:SOLE-R1 基于原始视频与自然语言目标,逐步执行时空思维链推理,输出稠密的任务进度估计直接作奖励;训练依赖大规模视频轨迹与推理合成管线,生成时间对齐的 CoT 标注,采用 SFT + 可验证奖励 RL 的混合框架。
- 结果:在 4 个仿真环境与真机设置中,机器人可从随机初始化零样本开始在线 RL,无需真值奖励、成功判据、演示或任务调参即可学会新的操作任务。
论文、代码、模型与数据均已公开,RoboPapers 播客将推出专题节目。
所属事件:MIT 发布 SOLE-R1:视频语言推理作唯一奖励训练机器人(2 条相关)→
「具身」频道最新
- ENPIRE 让编码 Agent 自主做机器人研究,灵巧任务成功率 99% — chris_j_paxton · 2026-10-09
- Odyssey-3 实测:冻结主干训练 20 小时驾驶数据即可迁移 — testingcatalog · 2026-10-09
- 机器人操作研究学者受邀在德州农工大学分享跨具身学习工作 — YuXiang_IRVL · 2026-10-09
- AGI House 携手 Google Gemma 办全端侧硬件黑客松,120 名开发者参赛 — agihouse_org · 2026-10-09
- Odyssey 发布世界模型 Odyssey-3,Physics-IQ 刷出新 SOTA — Scobleizer · 2026-10-09
- 估值390亿美元人形机器人公司Figure,4年10万台目标进度起底 — annatonger · 2026-10-09