XPACE: Joint World and Action Modeling from Heterogeneous Experience
Jiacheng Wei, Jerry Bai, Xiaoyu Yue, Zidong Wang, Xiaoyang Guo, Cheng Chen, Fanqi Pu, Fan Wu, Zhixu Yue, Yizhuo Li, Feng Qiu, Bo Liu, Yuying Ge, Hui Zhou, Chenyi Chen, Yixiao Ge
cs.RO
2026-09-16
小鹏 XPACE 用共享视频骨干同时当策略和模拟器,从约 5000 小时人机数据学控,再用自生成恢复轨迹微调;IRON 上倒水成功率从 50% 升到 95%。
通用人形机器人同时缺两类监督。人类第一人称视频覆盖广,标签却停在像素或人体运动学,跟机器人控制指令对不上。机器人遥操作有可执行动作,采集贵、场景窄。把两边倒进同一个训练集,并不自动得到一个既能出动作、又能按给定控制滚未来、还能用滚出来的视频再训策略的系统。
模仿学习还有第二个缺口。成功演示几乎不覆盖闭环执行时的偏离态。经典 DAgger 要人在环上标纠错。小鹏机器人团队的 XPACE 用同一套视频骨干把异构经验接进控制,再用自己的模拟器合成恢复轨迹。
数据做成四层金字塔,合计约 5000 小时具身视频。L1 是无动作标签的野外第一人称视频,只学视觉动态。L2 是带手部和腕部姿态的人类演示。L3 是任务对齐、外观对齐的人机桥接数据,靠任务和视觉重叠拉近两端,没有显式特征对齐损失。L4 是 IRON 上的遥操作。失败、低进展和恢复轨迹单独成 F,只训练模拟器,动作不进策略模仿。人和人形共用末端位姿、手部关节、躯干与相机这套运动学 schema,边界用各本体独立的线性投影。
模型是非对称 mixture-of-transformers:视频那路更重,动作那路只读视频特征。视频骨干从 Wan2.2-TI2V-5B 初始化,按 chunk 做因果预测,每个 chunk 4 个潜空间帧,对应 16 帧视频。策略模式吃视觉历史、当前状态和语言指令,同时出未来视频和 16 步动作。模拟器模式关掉语言和动作头,改吃给定的 2D 骨架序列和相机位姿。骨架用 token addition 加到对齐的视频 token 上,嵌入零初始化,免得一上来冲掉预训练表征。15 个动作块分别读视频块 16 到 30 的稠密特征。前向里动作改不了视频,动作损失的梯度会回流进骨干。
训练先 Stage I 只做视频预测。Stage II 以各 50% 交替策略和模拟,数据配比从宽人类与无标签视频收到目标机器人主导,Phase II-c 仍回放人类和桥接数据,不切成纯机器人微调。语言条件从稠密描述逐步换成部署用的任务指令。失败数据从 II-b 起只进模拟。
后训练把模拟器变成纠错数据工厂。Stage III-sim 用 chunk-wise self-gradient forcing:先无梯度自回归滚出上下文,再把生成前缀 detach 后重编码,对真实目标做 ℓ2 flow matching。采样从 50 步收到 8 步。不用分布匹配,因为模拟器必须跟给定控制一一对应,看起来像不够。Stage III-policy 另开一份 II-c 策略副本。绕专家轨迹,把位移最大的那只手臂沿与后续专家运动成 90° 到 150° 的方向偏出再拉回,模拟器只渲中间 2k 帧,前后仍用真实专家视频。DINOv3、深度加权 PSNR 和 SSIM 同时要求相对恢复和绝对一致性。过滤后的恢复样本占微调混合的 8%,一天内跑完。
真机评测在 IRON-R01-1.11 上,每任务每方法 20 次,对照 GR00T 和 DreamZero。机器人遥操作和有动作标签的人类数据对齐,Stage I 视频适配只有 XPACE 有。三任务套件里,香蕉抓放和倒水是分布内;叠碗不在 L4、在人类数据里,测的是人到机的技能迁移。
| 方法 | 平均进度 | 平均成功率 |
| XPACE | 0.84 | 68.3% |
| DreamZero | 0.68 | 40.0% |
| GR00T | 0.36 | 6.7% |
香蕉 16/20,五个预设位置都有成功;倒水 10/20,进度 0.78;叠碗 15/20。倒水是全场最难的任务,也是对 DreamZero 差距最大的一项:对方 1/20。0.78 的进度配 50% 成功率,说明很多试次走到了转腕,没把水倒出来。短时程视频预测上,token addition 相对 AdaLN,ID / OOD 的 PSNR 分别高 0.95 dB 和 1.11 dB。
全数据相对纯机器人:五位置香蕉成功率从 50% 到 80%,进度从 0.70 到 0.93;未见过的黄瓜、花、玩具鸭当干扰物,成功率从 30% 到 50%,进度从 0.48 到 0.74。Stage I 视频预训练在匹配动作微调后,评测动作损失最多降 12.5%,前 1/8 曝光已经贡献 8.1%。适应阶段继续混人类监督,相对纯机器人降损 14.0%;先人后机再纯机器人微调只有 8.5%。覆盖分层里,机器人没有、人类密集的行为上,共训降损 22.7%。
SGF 在 193 帧 ID 上把 PSNR 从 16.94 拉到 17.83,推理约 3.00 倍加速。DAgger 微调换了一套任务:香蕉、倒水、可乐递交。平均进度从 0.81 到 0.93,平均成功率从 61.7% 到 86.7%。倒水从 50% 到 95%,进度从 0.78 到 0.98。香蕉从 80% 到 90%,可乐递交从 55% 到 75%。
对人形这种和人手臂运动学接近的本体,人类运动学标签可以直接监督同一套动作目标,不必先压成夹爪开合。共享视频骨干让无标签视频、人类演示和机器人遥操作走同一套动态表征,模拟器才能按骨架把偏离态渲出来。8% 合成恢复就把倒水从半成功拉到接近满成功,指向闭环偏航才是模仿的瓶颈,不一定要再堆遥操作小时数。
能拿走的是配方:数据金字塔、粗到细回放、SGF 加过滤恢复。不能当成开箱权重。外部对比是整套模型和训练食谱对整套,不是架构消融。
论文写明了:DAgger 对比是微调前后,没有把恢复数据和多训一天拆开。外部基线也不是架构公平对比。桥接数据的单独贡献没拆。结论承认还停在绕演示造恢复,不确定性、更长的接触丰富交互、用真机反馈更新而不遗忘,都还没做。
评测偏窄。每任务 20 次,位置是五个预设点。策略-模拟闭环已经能抓到选错物体:指令要绿水果,模型拿红的;要弯曲水果,拿成瓶子。失败数据 F 不进策略,策略对失败态的覆盖几乎全靠合成恢复。没有公开代码和权重。