Hydra-0: Action Flow for Generalist World Modeling and Control
Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du, Yunzhu Li, George Konidaris, Stan Birchfield, Soha Pouya, Chenran Li, Yan Chang
cs.RO
2026-08-19
Hydra-0把机器人动作写成图像平面轨迹,跨手臂、双手和人手训练世界模型;相对6D动作基线夹爪误差降90.4%、物体误差降60.2%,开环评测Pearson r=0.96。
机器人世界模型要回答:执行这条指令之后,画面里的手臂和物体会怎么动。现有动作条件视频模型常绑在训练时的本体上。关节指令直接编码这台机器人的结构;同一套末端位姿在不同运动学上会走出不同的连杆轨迹。视频模型于是要学一条「命令→像素」的本体相关映射,换手臂、换双手、换人手就断。
Hydra-0把动作写成图像平面上的稀疏轨迹,叫action flow:可见机器人表面或目标物体上若干点的像素路径加可见性。格式跟关节空间无关,手臂、夹爪、人手都能用同一套条件。NVIDIA、Brown、Columbia、Harvard共同署名。主战场是可变形物体,显式状态和物理仿真都还不好使。
两条构造路径。有机器人几何和相机标定的时候,在Isaac Lab里把候选命令跑过控制器和物理,把连杆表面点投到相机平面,深度、画面内、深度缓冲一致才标可见。没有URDF、没有外参的公开视频,用AllTracker做稠密跟踪,再用接地掩膜把轨迹分给本体和物体。训练时四种条件随机抽:只给本体、只给物体、全给、全不给(条件dropout)。部署正向预测时,条件来自可执行命令的仿真投影,不再用未来视频。
条件注入沿ATI / Wan-Move:把首帧潜空间特征沿轨迹用高斯权重搬到未来格点,再加一个presence gate告诉主干哪里有运动条件。在Cosmos 2.5和Wan2.2(I2V-A14B、TI2V-5B)上接同一套接口,只改接入层。主干冻结,只训DiT patch embedding和rank-64 LoRA。语料七个来源、约178,187个episode、过滤后约2201.7小时,以布、绳、袋、纸等可变形交互为主。Wan2.2 A14B在32张H100上跑5天、40,000步。
长时延用LongLive-2.0式因果分块加KV cache,再DMD2蒸馏到每块4步。正向模式拿夹爪flow做开环策略回放。反向模式只给物体目标flow,世界动作模型在潜空间里补出兼容的机器人运动,轻量动作头读DiT token,映到可执行命令。配对真实轨迹即可,不要求专家示范。
五个验证集各100条、同一horizon。最佳配置是Wan2.2 A14B的4步蒸馏版。相对用原生相对6D末端动作微调的Cosmos 2.5基线,平均夹爪EPE从34.28降到3.29像素(约90.4%),物体EPE从13.23降到5.27(约60.2%)。PSNR/SSIM/FID/FVD也全面更好。同一Cosmos主干只换条件表示,夹爪EPE已从34.28降到13.80,说明增益主要来自像素动作接口,不只是换了更大的视频模型。ATI和Wan-Move零样本能出像样运动,物体EPE和FVD仍明显差一截。
| 方法 | 夹爪EPE↓ | 物体EPE↓ | FVD↓ |
| Cosmos 2.5(相对6D动作) | 34.28 | 13.23 | 405.8 |
| Hydra-0(同主干+action flow) | 13.80 | 6.27 | 277.4 |
| Hydra-0(Wan2.2 A14B 4-step) | 3.29 | 5.27 | 155.9 |
多本体中期训练之后,IWS六个任务在0%目标数据上已经强于从Wan2.2原权重起步;到20%任务数据,后续LPIPS最多再变3.4%、flow EPE 6.7%、FVD 6.8%。单卡H100、81帧480×832、关掉guidance和VAE时,4步学生61.98 fps,相对双向教师16.0倍(生成阶段,不含解码)。
RoboLab上5个策略、6个任务、每对10次、共300条episode,开环回放成功率与环境参考成功率Pearson r=0.96、Spearman ρ=0.93、MAE 5.7个百分点,跨任务平均还能保住五个策略的排序。真实折衣的成功/失败轨迹回放在观感上保住了结局。反向控制只展示了一条柔性管弯曲:从留出的人类示范抽物体flow,模型补机器人运动,动作头发出命令,实机跑通。没有任务级成功率表。
把「机器人怎么动」写成相机里能看见的轨迹,异构数据才能共训,开环评测和反向控制才能走同一接口。对可变形物体尤其实用:状态难重建,像素运动至少是大家都有的监督。从业者如果已经在用Cosmos或Wan做动作条件视频,换条件表示比换骨干便宜,这篇把这条路的数字打出来了。
开环r=0.96看起来漂亮,评的是「把已执行轨迹再放一遍,世界模型是否还得出同一成败」,不是闭环里策略盯着自己生成的帧继续控。反向控制目前是概念验证,还不能当通用模仿学习方案。
世界动作模型会有厘米级抓取不准,作者怀疑深度信息不够;生成回放里夹住没夹住有时也含糊。腕部相机只做了DROID上的定性展示。评测停在开环。反向控制只有一条柔性管任务,没有对照基线和成功率。训练语料偏向可变形物体,刚体、移动操作、大幅相机运动都还没系统测。4步学生的62 fps不含VAE解码,端到端会慢一截;真正上机器人的动作头用的还是50步教师。