W2-VLA:引入任务条件化未来手腕建模,优化精细机器人操作

Yuhao Pan · hf · 2026-08-07

当前的视觉-语言-动作(VLA)模型通常将主视图和手腕视图作为平行的视觉输入,忽略了手腕局部交互在全局任务背景下可能发生的变化。为了提升精细操作能力,研究者提出了 W2-VLA,一种引入了任务条件化未来手腕建模的 VLA 模型。

该模型的工作机制与贡献包括:

在 LIBERO、RoboTwin 2.0 及真实世界操作任务上的实验表明,该模型在单臂和双臂设置下均提升了精细和对接触敏感的操作能力,同时保持了 80 Hz 以上的动作生成率。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →