零机器人数据的灵巧抓取:HUG 真机桌面成功率 66.7%

Human Universal Grasping

Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu, Billy Yan, Irmak Guzey, David Fouhey, Dandan Shan, Lerrel Pinto

cs.RO, cs.AI, cs.CV, cs.LG

2026-06-16

NYU 的 HUG 只用人戴 Aria 眼镜抓到的 100 万帧训练 flow matching,预测 MANO 手再重定向到机器人。30 个未见物体的真机桌面上成功率 66.7%,比 Dex1B 高 23 个点。

这篇在解决什么

人每天随手抓几千个东西,多指机器人还差得远。数据是瓶颈。仿真里优化力封闭或用强化学习采样,有 sim-to-real 鸿沟,换一只手往往要重训。遥操作能拿到真机数据,但又慢又盖不住开放世界。

HUG 的判断是:最自然的抓取数据就是人自己。Aria Gen 2 眼镜能给标定 RGB-D 和手部关键点,人形灵巧手加上重定向又把形态差距缩小了。于是可以走人抓、模型学、部署时再映射这条链,训练阶段完全不碰机器人数据。

方法

先做数据集 1M-HUGs。采集者戴眼镜围着物体转 15 到 30 秒(手里还没出现),再伸右手抓住。Aria 的相机位姿把这一次抓取回放到前面所有无手帧上,一次物理抓取变成几百个「只有物体的图 + 抓取」对。过滤后剩 100 万 RGB 加 100 万灰度帧,约 1500 种物体、41 栋楼、6707 段录像。21 个关键点拟合成 MANO,形状参数锁成标准手,只留姿态,方便跨采集者对齐、进仿真、再重定向。

模型是点条件 flow matching。用户在 RGB-D 上点一下目标,网络输出 99 维抓取:腕部平移、6D 腕部旋转、15 个手指关节的 6D 旋转。RGB 走冻结的 DINOv2,点云在查询点周围 0.3 米裁切后走可训的 PointNeXt。点涂色把 DINO 特征粘到点云中心上,4 层融合 Transformer 之后,6 层 DiT 对平移、腕部旋转、手指三组 token 做速度预测。损失是速度 MSE 加上权重 20 的三维指尖监督,靠近干净样本时几何项更重。两张 RTX 5090 训约 10 小时。

部署时把 MANO 重定向到 Ability、WUJI 等灵巧手,开环走预抓、合拢、提起,不按手种再训。

结果

评测集 HUG-Bench 有 90 个未见物体,五类几何 × 三档尺寸,含很矮(约 1 厘米)和大而难握的东西。仿真测试成功率 73.0%,人类抓取回放上限 94.0%。去掉三维损失掉到 32.7%;只用 RGB 是 29.7%,只用点云是 70.7%。数据从 2.5 万帧扩到 100 万,测试成功率从 33% 到 73%,曲线还没平台。

真机 30 物体、每物 10 次:

方法桌面成功率至少成功一次
CAP(平行夹爪)32.7%20/30
Dex1B43.7%27/30
HUG66.7%28/30
HUG 野外(另一套手臂和相机)62.0%29/30

储物箱 10/10,野餐篮 9/10,喷瓶 9/10;足球和湿巾盒 0/10,Ability 手太小握不住。失败多发生在合拢阶段撞到物体或桌面。

为什么重要

灵巧抓取可以不靠机器人遥操作堆数据。人抓分布比「所有物理可行抓取」更可执行,重定向把同一套预测接到不同手上。代码、数据、基准和 demo 都公开。对做家庭机器人的人,这条链比再刷十亿仿真抓取更接近能用。

局限与存疑

只有右手、MANO 形状锁死,没有左手和双手。开环执行,接触中无视觉反馈。手被挡住时 Aria 追踪会松或会紧。输入 224×224,特别小的物体和特别远的大物体都会差。评测只在室内。CoRL 拒稿的讨论帮不上忙:论文自己已经把失败模式画清楚了,运动规划和带力合拢是下一步,不是这篇已经解决的。

术语

原文与代码

社区讨论

相关论文

全部论文解读