MIT 发布 SOLE-R1:视频语言推理作唯一奖励训练机器人
MIT 与 RAI Institute 发布论文 SOLE-R1(将被 NeurIPS 收录),提出用视频-语言推理模型作为在线强化学习的唯一奖励信号,让机器人无需人工设计奖励函数即可零样本在线学习技能,为机器人技能获取提供了新范式。
2026-10-08 ~ 2026-10-09 · 2 条相关
- MIT 提出 SOLE-R1:视频语言推理充当唯一奖励,机器人零样本在线学技能 — micoolcho · 2026-10-08
另有 1 条近重复转述:micoolcho