W2-VLA:引入任务条件化未来手腕建模,优化精细机器人操作
Yuhao Pan · hf · 2026-08-07
当前的视觉-语言-动作(VLA)模型通常将主视图和手腕视图作为平行的视觉输入,忽略了手腕局部交互在全局任务背景下可能发生的变化。为了提升精细操作能力,研究者提出了 W2-VLA,一种引入了任务条件化未来手腕建模的 VLA 模型。
该模型的工作机制与贡献包括:
- 潜在建模接口:W2-VLA 将一组潜在建模 token 作为视觉-语言模型与手腕预测器之间的紧凑接口。基于此接口和观察到的手腕历史动作,预测器会预测未来的手腕潜在状态,并将其转化为具有未来感知的上下文以指导动作生成。
- W2-CoT 合成流水线:引入了一个生成结构化注释的流水线,用于描述操作进度、物理过渡线索和手腕局部证据。这些注释提供辅助监督,有助于塑造任务条件化的潜在接口。
在 LIBERO、RoboTwin 2.0 及真实世界操作任务上的实验表明,该模型在单臂和双臂设置下均提升了精细和对接触敏感的操作能力,同时保持了 80 Hz 以上的动作生成率。
「具身」频道最新
- 宇树科技传将以 90 亿美元估值 IPO — zephyr_z9 · 2026-08-07
- 原力灵机发布开源具身大模型 DM0.5:单卡即可微调 — 机器之心 · 2026-08-07
- 机械臂跨界转行:从食品加工退役入职电子装配 — viktor_vrp · 2026-08-07
- DyPES-VLA:跨本体机器人操作,LIBERO成功率98% — Junfeng Li · 2026-08-07
- 非 YC 初创团队推销运动学世界模型数据 — andrew_n_carr · 2026-08-07
- ZecTrix Note 4 发布:ESP32-S3 驱动的 4.2 寸 AI 语音墨水屏 — churchkey · 2026-08-07