从人类视频到机器人:零样本奖励模型的早期探索
JasonMa2020 · x · 2026-08-13
作者回顾了将人类视频训练的奖励模型零样本迁移到机器人上的早期研究,指出该思路在当今标准下虽已显得古老,但奠定了基础。
- VIP 模型:引用了 2022 年的论文 VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training。该研究提出了一种自监督预训练视觉表示方法,能通过隐式时间对比目标生成时间平滑的嵌入,从而为未见过的机器人任务生成密集且平滑的奖励函数。
- 技术演进:作者提到 Jesse 相关的 Robometer 工作,并强调人类视频在赋予机器人奖励模型零样本能力方面有着悠久历史,而最近的 Dyna-2 则是首次在机器人动作上展现出缩放迁移效果。
所属事件:人类视频数据显著提升机器人泛化能力(2 条相关)→
「具身」频道最新
- 实探宇树 Unitree R1:轻量平价的迷你 G1 开发平台 — carlosdponx · 2026-08-13
- 前波士顿动力员工创业:打造“看一遍就学会”的机器人 — ycombinator · 2026-08-13
- MiniMax H3预算显卡优化指南:4070/5070/5080实测经验汇总 — BrooklynBrawl · 2026-08-13
- Gemini Robotics 2实测:人形机器人展现类人纠错能力 — keerthanpg · 2026-08-13
- 康奈尔校友创企 Budbreak 推出 AI 农业机器人 — broodsugar · 2026-08-13
- 人类视频数据显著提升机器人泛化能力 — JasonMa2020 · 2026-08-13