Latent Action as Intention Enables Efficient Future Imagination for World Action Models
Xiang Li, Yupeng Zheng, Songen Gu, Huailiang Ma, Feng Yu, Xian Nie, Shanshuai Yuan, Yujie Zang, Weize Li, Shuai Tian, Moyang Liu, Ya-Qin Zhang, Wenchao Ding
cs.RO
2026-08-26
LAWA 把潜动作序列当作未来意图,推理时不生成未来视频。RoboCasa 少样本成功率 65.6%、全量 80.8%,比匹配 Fast-WAM 高 9.6 和 4.5 点,延迟比 Joint-WAM 低 42.9%。
机器人操作策略不能只看当前画面,还得知道交互接下来会怎么走。World action model(WAM)把动作学习和未来视觉动态绑在一起。Joint-WAM 在测试时把未来画面也去噪出来,泛化好,但每出一个动作块都要先生成视频,延迟高。Fast-WAM 训练时还做视频预测,推理时把未来视频分支砍掉,更快;同一套复现里,少样本和分布外明显更弱。
清华、中科院自动化所、TARS Robotics 等这条线要的是中间态:测试时还保留对未来的想象,但别生成未来像素。
LAWA 把一段紧凑的潜动作序列当成未来意图。这里的意图是操作定义:动作专家能看到的、预测出来的状态转移目标序列。它编码接下来该发生哪些与操作相关的变化,不必重建未来画面的全部外观。
先训一个离散潜动作 tokenizer,骨架跟 ViPRA 接近。DINOv2 抽每帧 patch,非因果 Transformer 做分解的时空注意力,相邻帧特征做差,压成若干 token,再量化进可学习 codebook。因果前向解码器拿上一帧和潜动作去重建下一帧,逼代码里留下单靠静态外观推不出来的转移信息。
视频重建容易被场景外观主导,真正决定抓取成败的小交互反而被吃掉。论文加了一个 SAM 风格的 mask 解码器,用潜动作当 prompt,预测手或机械臂的 mask;监督来自 SAM 2 自动标,不用人手画。对照里 mask 比光流更有效。tokenizer 在无动作标签的机器人和第一人称视频上预训练,按源对齐运动速度,再加权重采样,让机器人视频大约占总样本的 20%。
策略训练时冻结 tokenizer,用它产出的 codebook 嵌入当潜动作目标。视频、潜动作、动作三个专家联合注意力,结构化 mask 禁止动作 token 偷看未来视频,但允许看正在去噪的潜意图。当前观测保持干净,三个未来目标独立加噪。推理时丢掉未来视频分支,只对潜动作和可执行动作块做 flow matching 联合去噪。量化目标是离散的,测试时在连续嵌入空间里放松,不做最近邻投影。
RoboCasa 24 个桌面任务,每任务 50 次试验。全量 24,000 条轨迹,每任务 1,000 条;少样本是 10%,每任务 100 条。
| 方法 | 少样本成功率 | 全量成功率 |
| DIAL | 58.3% | 70.2% |
| Fast-WAM(复现) | 56.0% | 76.3% |
| Joint-WAM(复现) | 64.1% | 78.8% |
| LAWA | 65.6% | 80.8% |
比匹配的 Fast-WAM 高 9.6 和 4.5 点,贴住 Joint-WAM。少样本比 DIAL 高 7.3 点。全量 VLA 里 JoyAI-RA 报 63.2%,仍低于这篇的 Fast-WAM 复现。
LIBERO-Plus 零样本:只在原版 LIBERO 上训,不去微调扰动集。LAWA 微平均 74.4%,匹配 Fast-WAM 60.0%,Joint-WAM 70.4%,OpenVLA-OFT 69.6%。相机视角和传感器噪声上相对 Fast-WAM 分别高 44.3 和 27.5 点。语言扰动上 LAWA 是 62.8%,低于 Fast-WAM 的 76.9% 和 Joint-WAM 的 91.8%。这条没跟上。
推理时给潜动作加高斯噪声,全量 RoboCasa 从 80.8% 掉到 52.2%;打乱时间顺序掉到 56.4%。这条通路是真被用上的。没有第一人称预训练时,LAWA 少样本 59.7%、全量 76.3%,还落后 Joint-WAM 3.4 和 2.0 点;加上之后才到 65.6%/80.8%。同一套视频下,LAWA 从第一人称预训练吃到的增益是 5.9 和 4.5 点,Fast-WAM 只有 1.5 和 1.7,Joint-WAM 只有 1.0 和 0.5。
A800 上每个动作块延迟:Fast-WAM 196.5 ms,LAWA 338.5 ms,Joint-WAM 593.1 ms,比 Joint 低 42.9%。真机四任务(齿轮、电池、积木、实验室),25% 数据 LAWA 平均 40.0%,超过 Fast-WAM 全数据的 33.8%。长程两任务上,Fast-WAM 在 25% 数据零成功,LAWA 分别 45.0% 和 30.0%。
WAM 的效率争论常被写成二选一:推理时生成未来视频,或者把想象整段删掉。LAWA 给出第三条路,把想象压进潜动作。延迟落在两者之间,成功率贴着贵的那边,少样本和真机长程差得更开。
对要上真机的人,338.5 ms 相对 593.1 ms 是可感知的。前提是先有一个 mask 监督、无动作视频预训练过的 tokenizer。没有这部分,潜动作并不比显式未来视频强。代码和权重写的是将发布。
没有第一人称预训练,潜动作接口还打不过 Joint-WAM。语言扰动上甚至明显更弱,论文没有单独解释。Fast-WAM 仍然更快。匹配实验共享数据划分和优化超参,但不共享参数量和推理开销,系统级对比不是等参数对比。mask 损失被写成操作导向的归纳偏置,不是学到语义的直接证据。真机每任务 20 次试验,样本很紧。