MIT 发布 SOLE-R1:视频语言推理作唯一奖励训练机器人

MIT 与 RAI Institute 发布论文 SOLE-R1(将被 NeurIPS 收录),提出用视频-语言推理模型作为在线强化学习的唯一奖励信号,让机器人无需人工设计奖励函数即可零样本在线学习技能,为机器人技能获取提供了新范式。

2026-10-08 ~ 2026-10-09 · 2 条相关

另有 1 条近重复转述:micoolcho