蚂蚁发布 2000 小时手机采集的具身操作数据集,带完整手部姿态与相机轨迹标注

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

cs.RO, cs.CV

2026-07-15

蚂蚁用 400 多部手机、500 多名贡献者采了约 2000 小时第一人称操作视频,带 MANO 手部姿态、相机轨迹和原子动作标注,并给出可复用的处理与训练工具链。

这篇在解决什么

具身基础模型卡在真实交互数据的规模和质量上。已有的第一人称数据集两头不靠:像 EgoDex、EgoLive 这类用专门头戴设备的,硬件门槛高、不好扩展;像 Ego4D、EPIC-KITCHENS 这种大规模被动视频,又缺机器人训练要的手部运动、相机轨迹、动作边界这些结构化信息。论文点出一个关键区别:放出视频和放出能直接拿来训练的数据,是两回事。

方法

Open-AoE 的第一版约 2000 小时操作视频,由 500 多名贡献者用 400 多款手机在自然环境中采集,覆盖 400 多个场景、8000 多个任务。标注包含英文文本、基于 MANO 的手部姿态、相机轨迹,以及时间对齐的原子动作。

把原始视频变成可训练样本,靠一条四阶段管线。第一步是端侧检测,用轻量模型对手部可见性和佩戴规范做门控,决定要不要录;第二步离线质检,做切片、帧率统一和基于 VLM 的语义打标;第三步重建与标注,用 DROID-W 估相机轨迹、用 HaWoR 重建 MANO 手部网格、做原子动作分割;第四步三道质检(完整性、正确性、一致性)。手机采集把成本压下来,这条管线把它变成结构化数据。

下游给了一整套工具:可视化工具能叠加 MANO 网格、关键点和轨迹;重定向工具支持跨本体(如 G1、Galbot/Galaxea、Sharpa、XHand),还能生成配对的人机视频做域迁移;训练接口按模型给出不同动作表示,比如给 LeRobot/world-action 的 110 维稠密 MANO、给 H-RDT 的 48 维腕-指尖、给 GR00T N1.7 的 62 维 Sharpa、给 SmolVLA 的 20 维夹爪,并配 VLA 策略、世界-动作模型(WAM)和世界模型的训练 recipe。

结果

论文拿一个 100 小时的样本做了统计:32,407 条不同的自然语言动作描述、175 个动词、8030 个物体、135 个场景,时间覆盖 99.99%,每分钟 13.97 段。

指标Open-AoE对比
时间覆盖99.99%OpenEgo 50.1%
图像-标注一致性4.583 / 5OpenEgo 3.029,EgoDex 2.916
Effective Rank(视觉多样性)97.43在多数对比中排第一

它是唯一一个五类监督(动作、边界框、置信度、手部姿态、相机姿态)全部齐备的数据集。

为什么重要

对做人机迁移、VLA 训练和世界模型的人,这是一套可以直接下手的开放基础设施:采集便宜、标注结构化、工具链覆盖从重定向到训练的各环节。它降低了贡献数据和复用数据两头的门槛。

局限与存疑

作者自己划了边界。所有统计都来自 100 小时随机样本,不是全集。相机域多样性带来的下游收益还是个「训练假设」,需要受控消融去验证。和其它数据集的一致性打分,是用同一个评估器做的跨库审计,不是在共享本体下的受控基准;语义广度比的是「已发布的语义监督的广度」,同样不是共享动作本体下的对照。换句话说,这些对比说明 Open-AoE 标注更全更密,但不等于在统一标尺下精度最高。

术语

原文与代码

相关论文

全部论文解读