机器人换 DINOv3 表示抗视觉漂移,真实成功率 25.8% 拉到 61.5%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

cs.RO, cs.CV

2026-07-31

像素级未来预测让世界动作模型遇视觉漂移就幻觉。ST-WAM 换用 DINOv3 表示,零样本抗漂移高 Fast-WAM 21.3 个点,真实成功率翻倍。

这篇在解决什么

世界动作模型(World Action Model,WAM)让机器人同时学动作和预测未来的画面变化,思路很漂亮。但它依赖「逐像素生成未来帧」来做监督,这就把「和任务相关的状态变化」跟「和任务无关的视觉内容」搅在了一起。一到视觉分布漂移的场景(背景纹理、光照变了),模型就不灵了。

作者把这个病灶起名叫 Training-Distribution Hallucination(训练分布幻觉):用带视觉扰动的观测去预测未来,预测出来的画面会偷偷漂回训练域的样子,而不是忠实于眼前的新场景。他们人工审计了 180 个预测,70.6% 都中招。

根源在于表示。他们做了个对照实验,发现 DINOv3 特征在视觉漂移下对同一状态更稳定(余弦相似度 0.904),而 Wan-VAE 的 latent 只有 0.686;同时 DINOv3 还能把不同任务状态区分开。换句话说,DINOv3 是更扛漂移、又不含糊的语义表示。

方法

ST-WAM(Semantic-Temporal WAM)的核心选择是:不去修正被污染的未来预测,而是改用 DINOv3 当共享的语义表示,同时保留 VAE 那套细粒度动力学。

两个关键模块。一个是 Dual-Space Future Experts(DSFE,双空间未来专家),一个三分支的 Mixture-of-Transformers:视觉未来专家(5B 的 Wan2.2 视频 DiT)预测未来 VAE latent,语义未来专家(1B DiT)预测未来 DINOv3 特征,动作专家(1B DiT)出动作。靠精心设计的 attention mask 控制信息流:当前的 VAE 和 DINO token 能互相看,但看不到未来和动作;两路带噪的未来流能互相对齐;动作 token 能看当前流,但看不到任何未来流。动作必须基于「现在」做判断。

另一个是 Current-Anchored Intent Retrieval(CAIR,当前锚定的意图检索),向历史要线索。用 Qwen3-VL 从当前观测和指令生成语义 token,去检索最近 4 帧的 DINOv3 历史(t-24、t-16、t-8、t-1),用 2 层 cross-attention 取出意图 token,只注入给动作专家。

端到端训练,不需要额外的具身预训练或任务级标注,推理时也不用真的把未来帧生成出来。

结果

LIBERO 基准,ST-WAM 平均 98.7%,已经把基线压得很平(Fast-WAM 97.6%、π0 94.4%)。真正的差距在抗漂移。

零样本的 LIBERO-Plus(带视觉扰动)最能说明问题:

方法零样本准确率
π053.6%
Fast-WAM51.5%
OpenVLA-OFT69.6%
ST-WAM72.8%

ST-WAM 比 Fast-WAM 高 21.3 个点。分扰动看,相机扰动 +39.0 个点、噪声扰动 +41.8 个点,提升集中在最容易让旧方法翻车的地方。

真实世界更直观:标准场景下 ST-WAM 79.3%、Fast-WAM 64.7%;视觉漂移场景下 ST-WAM 61.5%、Fast-WAM 只有 25.8%,后者直接腰斩还多。从标准到漂移,Fast-WAM 掉 38.9 个点,ST-WAM 只掉 17.8 个点。RoboTwin 2.0 上 ST-WAM 92.77%,也略高于 Fast-WAM(91.83%)和 LaWAM(91.22%)。

为什么重要

机器人策略部署到真实世界,摄像头抖一下、灯光变一下就失效,是落地最大的拦路虎之一。这篇把锅明确扣在「像素级未来预测」上,并用「换成 DINOv3 语义表示加历史检索」给出了一个不靠额外预训练就能大幅抗漂移的方案,视觉漂移场景成功率翻倍。对做通用操作策略的团队是直接的工程参考。

局限与存疑

抗的是视觉分布漂移,对物理动力学变化(物体重量、摩擦)和不同本体的迁移,作者只列为未来工作,目前没验证。代价是推理延迟增加 1.24 倍(756ms 对 609ms),对需要高频控制的场景要掂量。论文没有专门的局限小节,上面这些局限是读出来的判断。

术语

原文与代码

相关论文

全部论文解读