DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation
Junfeng Li, Junjie He, Zhide Zhong, Yangyang Zheng, Pingyue Sheng, Jiayu Dong, Ruixin Li, Haodong Yan, Jiaguan Zhu, Tianran Zhang, Runze Yu, Wen Chen, Liuqing Yang, Yuxiang Gao, Haoang Li
cs.RO
2026-08-07
港科广团队的 DyPES-VLA 不把异构机器人硬塞进统一动作格式,而是用未来帧预测学一套跨本体共享的「动力学先验」query 表示,再由各本体专属 MoE 动作头解码;单检查点在 LIBERO/RoboTwin 2.0/RoboCasa-GR1 上分别拿 98.0%/89.02%/59.25%。
想训一个能通吃不同机器人的 VLA(vision-language-action,视觉-语言-动作)策略,卡在两点。一是现有方法只拿动作标签当监督,浪费了大量人和机器人操作视频里反复出现的物体运动、接触、场景变化这些规律。二是为了把不同机器人的动作塞进统一格式,得做大量手工预处理(坐标变换、逆运动学),换种机器人形态就难扩展。更糟的是,这种硬对齐把「跨本体共享的交互规律」和「每个机器人独有的控制语义」搅在了一起。港科广团队要把它俩分开。
DyPES-VLA 用一组可学习的 query token 当共享接口。VLM 把视觉、指令、本体元数据(机器人型号、控制频率、动作维度等)和这组 query 一起编码,输出 query state。关键是两路监督。第一路是未来生成头,强迫这些 query state 去预测未来帧,因为生成未来帧所需的物体运动和接触信息必须穿过 query token,这就逼着 query 学到跨本体共享的动力学先验,而且这一步不需要动作标签,能吃大量无动作视频。第二路是动作头,一个 flow-matching 的 DiT(diffusion transformer)。它的注意力层跨本体共享,捕捉动作的时间结构;前馈网络则是 K 个本体专属专家,由本体元数据静态路由,直接在各自原生动作空间生成动作块,不用预先对齐。训练分两阶段:先在无动作的人/机器人视频上预训 query 和未来头,再在多本体带动作演示上联训两路;推理时未来头扔掉。
| 基准 | 本体 | DyPES-VLA | 主要对手 |
| LIBERO | 7-DoF 单臂 | 98.0% | X-VLA 98.1、Fast-WAM 97.6 |
| RoboTwin 2.0 | 14-DoF 双臂 | 89.02% | Qwen-VLA 86.65、ABot-M0 85.5 |
| RoboCasa-GR1 | 29-DoF 人形 | 59.25% | ABot-M0 58.3、LDA-1B 55.4 |
单检查点在三榜都达 SOTA,但有的领先很窄(LIBERO 只比 Fast-WAM 高 0.4、比 X-VLA 低 0.1;RoboCasa 只比 ABot-M0 高 0.95)。真机更有说服力:同一个检查点在 FR3 单臂、COBOT Magic 双臂、G1 人形上微调,三任务平均 75.6%,比 GR00T-N1.6 的 59.6% 高 16 个点,把 ACT 的 32.4% 远远甩开。消融里,去掉未来预测损失最大(RoboTwin 掉 2.4、RoboCasa 掉 2.5);一个线性探针证实加了未来监督后,query state 里确实能线性解码出未来的接触发生与结束(AUROC 全面提升)。
它给跨本体机器人训练指了一条干净的路:共享的归共享(用无动作视频和未来预测学交互规律),专属的归专属(用 MoE 专家在原生动作空间解码),不必再手工统一动作格式。对做通才机器人的团队,这意味着加一个新机器人本体可能只要加一组专家、喂它的演示,而不必重做整套对齐。真机三本体 75.6% 的平均成功率说明这套共享先验确实能迁移到不同形态的物理控制。
VLM 主干只用 Qwen3-VL-2B,偏小,论文没测更大主干带来的上限。仿真里的领先很多时候是零点几个点,统计上未必稳。真机只测了三个桌面任务(放猕猴桃、倒水、放书),都是相对简单的抓放,没碰更难的装配或长程任务。论文通篇没讨论失败模式。共享先验到底在多大程度上来自跨本体联训、而非来自单本体内的未来预测,消融没有把「跨本体」这个变量单独切出来。