RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning
Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul, Gaotian Wang, Bowen Wen, Chen Wei, Kaiyu Hang
cs.CV, cs.RO
2026-09-03
RoboTok用躯干中心3D手轨迹检索网视频,mAP@20达0.35;难设定杠杆滑动79.3%,HAND为19.5%。
灵巧手和人形机器人要学操作,示范数据是瓶颈。Open X-Embodiment、DROID、ALOHA这类本体采集贵,长尾任务盖不住。网上人类操作视频几乎天天在长,但画面或语义相近,并不等于手在做同一件事:同一套拧瓶盖可以出现在完全不同的厨房里。
已有检索方法大多在固定机器人语料上工作。FlowRetrieval用光流比运动,STRAP用视觉基础模型特征再加子序列动态时间规整,HAND先按画面筛再比二维手路径或末端路径。它们面向平行夹爪,查询也不是互联网人类视频。Rice大学与NVIDIA的RoboTok换了一个设定:给一段人手操作查询视频,从网视频里找出运动结构相近的人类示范,再拿去训灵巧手策略。
训练数据来自Action100M。流水线自动留下4到8秒、相机接近静止、每段最多一只左手一只右手的片段,重叠段按更长优先贪心去掉。人手21个关节用WiLoR按每秒5帧估3D,MoGe-2把弱透视重建拉到度量相机坐标,缺帧用HaWoR补。到这一步轨迹仍绑在相机上,换机位就对不齐。
接下来把轨迹变到演员中心坐标系。一个轻量躯干估计器只吃手腕坐标系,预测演示者静止的躯干框,身体被挡住也能用。对齐之后,用动态时间规整(DTW)当运动相似度的伪标签:允许两段动作快慢不同,按阶段对齐3D手姿态再累加欧氏距离,长度归一后取负作为分数。
十万段两两算DTW当检索用不了。RoboTok拿这份DTW当监督,训一个轻量编码器:每帧做位置编码,交叉注意力池化成L2归一化向量,用内积近似DTW排序。训练库10万段,每批196条,由49组拼成。每组一个锚点、两个抽自DTW前20邻居的正例、一个刚好掉出相关集的边界负例。随机负例太容易,边界负例才卡在该不该进前20这条线上。损失分两块:集合损失把真正邻居抬到边界负例之上,排序损失让正例之间的相对名次跟DTW一致。上线时轨迹只过一次编码器,检索变成余弦近邻。新片段一次前向就能入索引,不必重训。
检索评测在10万段里留出1万查询,相关集取DTW最近20邻。最强基线STRAP的mAP@20只有0.007,Recall@20约0.12。RoboTok的mAP@20是0.353,Recall@20是0.996,几乎每个查询都能在前20里捞到真正的DTW邻居。Kendall τ为0.487,邻居次序也对得上。平均DTW代价1.333米,真邻居1.145米,高16%;随机是4.776米。FlowRetrieval和HAND基本贴着随机,光流在这项指标上甚至比随机更差(6.612米)。
外推到AssemblyHands:831段双手装配、传感器级3D标注,相关集k=5。RoboTok的mAP@5为0.261,STRAP为0.133。DTW代价1.095米,真邻居0.966米,高13%;随机1.911米。本分布上的巨大领先收窄了,但排序没有变。
下游在VTDexManip仿真里从零训PPO。检索片段只进奖励:当前手姿态到重定向示范库的加权k近邻距离,再加势能塑形,不改任务最优策略。没有机器人示范,也没有动作标签。八个种子,每物体100次尝试。
| 任务(原始设定,seen) | Base | VT-JointPretrain | RoboTok |
| 拧瓶盖 | 55.9% | 83.7% | 90.2% |
| 拧水龙头 | 49.0% | 80.1% | 91.3% |
| 杠杆滑动 | 5.8% | 89.3% | 95.5% |
| 桌面重定向 | 51.8% | 85.0% | 82.6% |
| 掌内重定向 | 38.1% | 62.2% | 76.6% |
| 双手交接 | 8.0% | 45.5% | 54.3% |
六项里五项超过该基准最好的预训练方法,seen平均高7.45个百分点,unseen高5.83。桌面重定向是例外。
原始设定已经饱和。把三项需要腕部运动的任务改成全3D手控制并去掉稠密奖励后,差距拉开:拧瓶盖seen 77.3%,HAND 59.5%;拧水龙头44.8%对6.8%;杠杆滑动79.3%对19.5%。Base和随机检索在这套难设定上接近0。
对做灵巧手和人形机器人的人,这是一条不采本体数据、只用人类网视频当示范库的检索路径。查询是视频不是语言,适合已有一段想模仿的动作、再去网上扩同类。编码器轻、索引可增量,新视频一次前向就能挂上。
别把它读成已经能量产的数据引擎。训练索引是10万段筛过的Action100M片段,不是未过滤的全网。下游只在仿真里,奖励里显式跟踪检索到的手姿态,策略输入是本体感觉加指尖力,没有视觉。检索真值本身就是同一套3D手轨迹上的DTW,本分布上的领先有一部分来自表征对齐。AssemblyHands上的优势还在,mAP大约只剩一倍。
论文没有单独的局限节。结论里写了下一步:处理运动相机,包括第三人称和第一人称。筛片条件已经把运动相机、多手、过短过长片段排除了,能进索引的网视频只是一个窄子集。
躯干框只从手腕估,没有做去掉这一步的消融。桌面重定向输给了用视觉触觉预训练的VT-JointPretrain。双手交接的unseen上,随机检索42.1%高于RoboTok的34.8%。没有真机实验。internet-scale目前验证的是10万级向量检索,不是持续接入新网站视频的系统指标。