W2-VLA: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

Yuhao Pan · hf · 2026-08-07

Vision-language-action (VLA) models often treat main-view and wrist-view observations as parallel inputs, overlooking how wrist-local interactions evolve under the global task context. To improve fine-grained manipulation, researchers introduced W2-VLA, a VLA model featuring task-conditioned future wrist modeling.

Key mechanisms and contributions include:

Experiments on LIBERO, RoboTwin 2.0, and real-world tasks demonstrate improved fine-grained and contact-sensitive manipulation across single-arm and bimanual settings, while maintaining action-generation rates above 80 Hz.

Original post →

More from Embodied

Embodied channel →