SOLE-R1:用视频语言推理作唯一奖励,机器人零样本在线 RL 登 NeurIPS

micoolcho · x · 2026-10-09

MIT 与 RAI Institute 的论文 SOLE-R1(将被 NeurIPS 2026 收录)提出用视频-语言推理模型作为在线强化学习的唯一奖励信号。要点:

论文、代码、模型与数据均已公开,RoboPapers 播客将推出专题节目。

所属事件:MIT 发布 SOLE-R1:视频语言推理作唯一奖励训练机器人(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →