12万小时第一人称视频,真机零样本成功率从36.1%拉到77.8%

ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

Xionghao Wu, Yijun Yang, Shiyang Zhou, Haoze Sun, Jianhui Liu, Songsong Yu, Jiyao Zhang, Wenbo Li, Bo Wang, Guoqing Ma, Lin Song, Renjie Liao, Shenghe Zheng, Wei Tang, Xiaojuan Qi, Yanwei Li, Yuan Zhang, Zhuotao Tian, Haoyang Huang, Nan Duan

cs.CV

2026-09-01

ZimaBlue用12万小时第一人称视频预训练世界动作模型,真机12项零样本任务成功率从36.1%升到77.8%,并在RTX 4090上把闭环延迟压到33毫秒。

这篇在解决什么

通用操作机器人缺的不是策略骨架,是可规模化的身体经验。带动作标注的机器人轨迹贵、场景窄;第一人称视频便宜、种类多,但没有可执行的动作标签。现成的视频生成模型又是为「画面好看」训的,整段双向看、一次吐很长,跟机器人必须按已发生观测逐步决策对不上。

ZimaBlue 把这条路收成一个世界动作模型(WAM):先从无动作视频里学因果视觉动态,再用跨本体轨迹把动态接到控制上,最后在目标机器人上校准。机构来自 Joy Future Academy,骨干从 Wan2.2-TI2V-5B 改过来。

方法

训练分三档数据金字塔。第一阶段只做因果视频预训练,数据含 EPIC-KITCHENS、EgoDex、DROID、AgiBot 等,规模拉到超过 12 万小时;动作用占位符,Fast 分支不开。第二阶段用 DROID、AgiBot、Galaxea、RoboMIND2-Franka 四类本体做视频-动作联合流匹配,把原生接口投进统一的 100 维语义槽(末端位姿、夹爪、关节、躯干、底盘、灵巧手),无效维用 mask 去掉。第三阶段才在目标本体上专化 Slow,并冻结 Slow 去训 0.5B 的 Fast。

Slow 是 5B 的 DiT,联合预测未来视频潜变量和辅助动作;Fast 吃最新观测,并交叉注意 Slow 前 12 层的视频 K/V 缓存,用来出高频动作。部署时两边异步:Slow 低频更新世界引导,Fast 用 RTC 式前缀保持动作连续。再加 DMD 蒸馏(每支从 8 步压到 2 步)和编译,闭环从 450 ms 降到 33 ms,约 30 Hz。

结果

真机在 7 自由度 Franka 上评 12 项零样本任务(标准 8 项、扰动 4 项),每项 10 次。所有变体都在同一份 DROID 上后训练。

配置标准套件扰动套件总体
仅目标本体(Baseline)46.7%15.0%36.1%
+6k 小时跨本体57.9%22.5%46.1%
+6万小时视频82.9%35.0%66.9%
+12万小时视频87.9%57.5%77.8%
π0.565.4%32.5%54.4%
DreamZero61.7%37.5%53.6%

跨本体数据主要抬接触丰富的执行(微波炉关门从 0/10 到 9/10)。视频从 6 万加到 12 万小时,标准套件只再涨 5.0 点,扰动套件跳 22.5 点。Slow-Fast 相对纯 Slow,标准套件从 80.8% 到 87.9%,扰动套件从 30.0% 到 57.5%。仿真上,LIBERO-Plus 零样本 86.7%、任务内 SFT 92.0%;RoboTwin 2.0 清洁/随机 94.7%/94.3%;RoboCasa365 的 Composite-Unseen 到 16.5%,超过 ABot-M0.6 的 7.9%,仍低于用了 10 万小时真机数据的 Xiaomi-Robotics-1。仿真评测只用 Slow 分支。

为什么重要

这给「视频能不能当机器人的主缩放轴」提供了一条可复现的证据链:同样的 DROID 后训练,视频从 0 加到 12 万小时,零样本成功率翻倍有余,而且多出来的分主要落在没见过的视觉扰动上。WAM 相对 VLA 的代价是慢,Slow-Fast 把这条代价压到消费级 GPU 上可跑的 30 Hz。对做操作策略的人,更实际的用法是:视频预训练加跨本体对齐,目标本体数据仍然要有,只是可以少很多。

局限与存疑

完整模型在扰动套件上每项仍只有 5/10 到 7/10,失败多为中间状态走不下去、丢接触、去抓桌布。仿真三套基准没有开 Fast,所以 30 Hz 那套系统没有在 LIBERO/RoboTwin/RoboCasa 上对过公平对照。真机每项 10 次,单项波动大,论文自己也把权重放在套件均值上。120k 小时视频相对互联网视频仍是小样本,作者也把它写成后续要继续加的轴,而不是已经打满的规模。

术语

原文与代码

相关论文

全部论文解读