Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin
cs.RO
2026-08-04
把约 1,940 小时第一人称人类操作视频,经手部重定向、机械臂渲染合成、三级质量过滤,转成跨 15 种机型的机器人训练数据;与真机数据 1:1 混合预训练,在扰动泛化基准上全面优于纯机器人数据,真机 5 个长程任务全部领先。
视觉-语言-动作模型(VLA)已经能让机器人照图执行复杂操作,但泛化能力卡在一个老问题上:真实机器人示教数据太贵、太少、太单一。Open X-Embodiment、DROID、AgibotWorld 这些数据集受限于硬件数量、遥操作成本和交互多样性,扩不动。
第一人称视角的人类操作视频是另一种可能。人手交互的视频海量、场景杂、物体多,天然带着机器人学不到的操作先验。难点在于人和机器人的身体差异太大:把人手运动「重定向」成机器人轨迹、再把画面里的人胳膊换成渲染出来的机械臂,这条路在小规模、单任务上验证过有效,但放大到能给 VLA 预训练用、还真能提升泛化的规模,此前没人走通。
Ego2Robot 把第一人称视频转成机器人训练数据,分三步。
动作对齐。先用 21 个手部关键点算出一个虚拟指尖(食指 0.7、中指 0.3 加权),再推出夹爪中心、张口宽度和抓取朝向三轴,得到末端执行器轨迹;Savitzky-Golay 滤波和高斯加权 SLERP 抹平帧间抖动。人手动作比机器人快得多,所以按来源降采样(ANT、EgoDex 降到原帧率 60%,EgoVerse 45%,ViTRA 25%)对齐速度分布。
视觉对齐。SAM 3 分割人臂区域,ProPainter 做时序一致的视频修复,把人胳膊抹掉、补出背景。关键一步是找机器人底座位置:第一人称视频里没有「机器人底座」可参考,作者把轨迹关键帧的 IK 可行性当目标,在轨迹质心周围网格搜索,选可达率最高的底座姿态。这件事对 15 种机型各做一遍,因为臂长和关节配置不同,同一条轨迹需要的底座位置不同。最后在 MuJoCo 里逐帧解 IK,按深度合成把机械臂渲染进原场景。
质量过滤分三级:L1 拦 IK 失败、自碰撞、动作离群的帧;L2 按统计量删掉跳变和无效帧过多的轨迹;L3 让视觉语言模型审核合成视频里机器人动作和原始操作意图是否一致。
输入分两条路:Path A 吃带手部姿态标注的数据集,Path B 处理裸视频,用 WiLoR 加 DynHaMR 估手姿,Qwen3.5 把长视频切成带自然语言描述的子任务。四个来源(ANT 7 小时、EgoDex 732 小时、ViTRA 249 小时、EgoVerse 954 小时)合计约 1,940 小时,经 15 种机型渲染和质量过滤产出 18,561 小时训练数据。动作用相机系相对末端表示,因为各路视频机位未知、没法统一到世界系。模型是 Qwen3.5-4B 主干加扩散 Transformer 动作头,预训练 20 万步。
作者把 RoboTwin2.0 拆成四个互不干扰的扰动轴(视觉外观、场景布局、机型、任务语义),这一点本身就是评测上的贡献:以往基准把多种分布偏移打包成一个分,看不出谁拖了后腿。
主结果(RoboTwin2.0 加 EBench,成功率 %):
| 预训练 | Clean | 随机扰动 | EBench |
| 纯机器人 | 62.2 | 50.9 | 39.6 |
| Ego2R+机器人 1:1 | 68.1 (+5.9) | 53.5 (+2.6) | 49.8 (+10.2) |
Ego2R+机器人 1:1 在七项里五项领先,3:1 配比在 EBench 上最高(51.7,+12.1)。拆开看,视觉外观受益最大:1:1 配比下背景 +4、光照 +8、机身颜色 +6,主要来自视频里的场景多样性和 15 种机型的渲染差异。机型迁移上,ARX 从 44 升到 51,UR5 在 3:1 时到 31,但 Franka 始终低于 7%(运动学差距太大)。任务语义持续改善:未见过的物体从 29% 涨到 40%(3:1,+11),改写指令的鲁棒性到 69%(1:1)。
消融(只用 ego 数据预训练)最能说明管线价值:裸 ego 视频只有 28.1%,过一遍管线(单机型)升到 31.7%(+3.6),扩到 15 机型 33.5%,再把裸 ego 当「第 16 种机型」混进来跳到 37.3%。真机实验(ARX ACone 平台,5 个长程任务)里,Ego2R+机器人 1:1 预训练再加一段自录的 ego 操作视频转换数据,五个任务全部最优,放积木 +14、拧螺丝 +13。
诚实地讲,绝对提升不算大(RoboTwin 上 +2.6 到 +5.9),18,561 小时这个数字也是把约 1,940 小时的人类行为跨 15 种机型渲染放大的结果,不是 18,561 小时全新的操作行为。这篇真正的价值在两点:一是合成数据带来的是分布外鲁棒性(视觉、机型、语义扰动上增益集中),说明它教会模型的是不变性,不只是多覆盖几条轨迹;二是这种数据近免费、可扩展,真机实验里随手录 7 分钟手部视频转成训练数据就能稳定涨点,对缺数据的从业者很实际。解耦评测协议本身也是个能复用的贡献。
作者自承:重定向只映射到平行夹爪,丢了手指精细动作,做不了灵巧手;视觉对齐靠修复和深度合成,严重遮挡或复杂光照下会有伪影;评测只覆盖 RoboTwin2.0 的任务范围。
读完要补一句存疑:头部那个 18,561 小时是 9.6 倍放大,真实行为多样性仍是 1,940 小时那批;Franka 机型始终低于 7%,说明跨机型迁移在运动学差距大时仍崩;底座搜索假设场景里只有单臂。增益在 RoboTwin 上偏温和,大头落在 EBench 和扰动维度上,读结果时得分清是哪个设置。