伯克利 Do as I Do:普通视频直接变成灵巧手操作训练数据
JitendraMalikCV · x · 2026-09-20
UC Berkeley 的 Jitendra Malik(与 Pieter Abbeel、Mahi Shafiullah 等)回复展示其「Do as I Do」工作:从日常单目 RGB 人类视频(第一/第三视角、野外来源)中重建手-物体交互,并重定向到多指灵巧机器人手可执行的动作序列,直接产出可用的机器人操作数据,解决了人类视频难以规模化用于机器人训练的瓶颈。
要点:
- 算法在带真值数据集和网络视频数据集上的手-物体重建与轨迹提取均超过此前 SOTA
- 提供了采集人类操作数据的实践手册(playbook)
- 发布论文与代码
- 回复语境:YuXiang 等提到团队花近两年搭建多视角手-物姿态捕捉系统,而这类问题如今被更快解决,凸显领域进展速度
所属事件:Astra 手物重建引热议,研究者澄清非一次成型(3 条相关)→
「具身」频道最新
- 8 个切割头盲切芹菜基部,特种作物自动化攻入最难场景 — anselm · 2026-09-21
- CV 大佬 Jitendra Malik:机器人弃用 3D 结构是在浪费宝贵信号 — JitendraMalikCV · 2026-09-21
- Eric Topol 质疑可穿戴 HRV 与 Readiness 评分缺乏健康证据 — EricTopol · 2026-09-21
- 蟑螂可被远程操控携带相机与注药装置,用于灾难救援 — Distinct-Question-16 · 2026-09-21
- 15 分钟、10 美分:用 Jev 判断模型让纯视觉无人机穿越障碍赛道 — alex_verem · 2026-09-20
- Humanoids Summit 两天后在首尔开幕,聚焦人形机器人产业 — jonstephens85 · 2026-09-20