SOLE-R1 入选 NeurIPS:零样本奖励预测让机器人从零学会 20+ 新任务
___Mufasaa · x · 2026-09-30
- 研究团队宣布通用奖励模型论文 SOLE-R1 被 NeurIPS 2026 接收。
- 核心发现:SOLE-R1 的零样本奖励预测可以作为在线 RL 的奖励信号,让机器人在完全随机初始化的策略下(初始成功率 0%)学会超过 20 个未见过的操作任务。
- 意义:零样本稠密奖励预测驱动的 RL 不只能提升已有任务的成功率和速度,还能让机器人在没有任何演示或真值奖励的情况下,从零能力开始学会全新任务。项目主页已上线。
「具身」频道最新
- DexTacWAM:视觉-触觉世界模型让灵巧手 6 项任务全胜基线 — berkeley_ai · 2026-09-30
- 伯克利触觉压缩器将 10 指数据压缩至 2 个手部潜变量,训练提速 2.26 倍 — berkeley_ai · 2026-09-30
- 伯克利 DexTacWAM:视频世界模型迁移为触觉,灵巧操作全任务夺冠 — berkeley_ai · 2026-09-30
- OpenAI DevDay 现场机器人鸭子演示:控制丝滑引发热议 — gabrielchua · 2026-09-30
- IDC:上半年全球人形机器人出货 77.9% 来自中国 — yogthos · 2026-09-30
- Flourish 家用机器人亮相:手机教学 30 分钟即可学会新任务 — philfung · 2026-09-30