W2-VLA:预测手腕视角的近未来,给机器人精细操作加上任务条件的前瞻

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

cs.RO, cs.CV

2026-08-06

用全局任务上下文约束的手腕未来潜在预测给精细操作加前瞻;LIBERO 达 98.5%、真实双臂插拔 OOD 成功率 33%,推理 87Hz。

这篇在解决什么

视觉、语言、动作(VLA)模型把摄像头画面和语言指令映射成机器人动作。现在多数多视角 VLA 把主视角和手腕(wrist)视角摄像头当成两路平行的视觉输入,一视同仁地编码融合。但这两个视角角色不同:主视角给全局任务背景(场景布局、目标物体、任务进度),手腕视角直接暴露末端执行器周围快速变化的夹爪与物体交互。对插拔、对齐这类精细操作,全局理解和局部交互动态必须紧密配合,把手腕视角只当一路普通输入是浪费。

W2-VLA 的切入点:不光看手腕当前的画面,还预测它接下来会怎么变,并用全局任务上下文来约束这个预测。

方法

W2-VLA 基于 StarVLA 框架、Qwen3-VL-4B 主干和 DiT 流匹配动作头,约 4.97B 参数。核心是一个「任务条件化的潜在接口」连起全局上下文和手腕未来预测。

第一步,VLM 用当前多视角观测和指令,把一组(16 个)专门的「潜在建模 token」上下文化,取它们最后一层的隐藏状态作为一个定长接口。它编码了「这个任务现在进行到哪、接下来局部该怎么动」。

第二步,手腕分支用冻结的 V-JEPA 2.1 编码器把手腕历史画面编码成 token,以上述接口为条件,用一个双向 Transformer 预测未来手腕的潜在表示,目标是逼近真实未来手腕片段编码出的潜在向量(训练时才有,推理不需要)。预测出的密集潜在向量用一个 Q-Former 风格的适配器压成 32 个「未来感知」上下文 token。

为了把接口塑形成真正带任务条件的表示,作者设计了一套 W2-CoT 结构化标注(用离线 VLM 合成),每条含三个字段:子任务(当前阶段和进度)、推理(机器人视角的物理转移,如接近到接触、抓稳、搬运、对齐、释放)、手腕证据(目标临近、指尖接触、抓取稳定性等;双手数据用 left 加 right 的格式)。这些标注只在训练时当辅助预测目标,推理时不解码。

最后,把 VLM 动作上下文和未来感知手腕上下文拼起来,送给流匹配动作头生成动作块。

结果

仿真 LIBERO 上,四套任务平均成功率 98.5%,比最强基线(VLA-JEPA 97.2%)高 1.3 个百分点,Spatial、Object、Goal 三套分别达 99.6、99.8、99.2,长程 Long 套 95.2。双臂基准 RoboTwin 2.0 上,干净设置(Easy)60.71%,比最强基线 UP-VLA 高 7.79;域随机化设置(Hard)18.21%,比 π0 高 1.87。

真实世界在 CoBoT Magic(基于 Mobile ALOHA)上做三个任务:桌面清理(长程)、遮挡放置(全局到局部协调)、双臂插拔(精细双臂)。标准条件下三任务平均成功率 70%,比 VLA-JEPA 高 15.56、比 π0 高 28.89;分布外(加桌面杂乱、光照、背景扰动)平均 52.22%,比 VLA-JEPA 高 14.44。最难的双臂插拔分布外成功率 33.33%,而 VLA-JEPA 只有 10%。

效率是这套设计的关键卖点:用定长潜在接口,生成一个 16 步动作块只要 183 毫秒,动作频率 87.43 Hz,满足实时部署;而要在推理时显式解码 CoT 的变体,每个动作块要 1.5 秒以上。

消融说明每个部件的作用。去掉手腕预测器,LIBERO 平均从 98.5 掉到 97.5,长程 Long 套掉得最多(95.2 掉到 93.6),说明未来手腕预测对时间跨度大的任务最有用;去掉 W2-CoT 监督掉到 98.0。预测目标上,只预测手腕视角比预测主视角或两者同测都好,主视角静态内容多,其未来潜在量对动作引发的局部变化不敏感。

为什么重要

精细操作(插拔、对齐、接触敏感任务)是机器人操作里公认难啃的硬骨头,手腕视角又是离动作最近的观测。W2-VLA 把「预测手腕未来」做成一个受全局任务约束的潜在预测目标,既给模型前瞻能力,又靠结构化标注把它锚定到任务进度上,推理时还不用慢吞吞地显式推理。对做机器人 VLA 的人,这是一条把视觉前瞻和实时控制兼顾的具体路线。

局限与存疑

论文没单列局限章节,但结果本身暴露了几点。RoboTwin 2.0 Hard 设置只有 18.21%、双臂插拔分布外只有 33.33%,接触最敏感的任务上绝对成功率仍低,离实用有距离。真实世界只评了三个任务、每个 100 条示教,规模偏小,泛化性主张还需要更多任务验证。LIBERO 涨幅小(涨 1.3 个百分点)也部分因为该基准已接近饱和,真正的增量主要体现在更难的 RoboTwin 和真实插拔上。整套方法依赖冻结的 V-JEPA 2.1 编码器,手腕表征质量上限被它卡住。

术语

原文与代码

相关论文

全部论文解读