MaskedVisualActions Turns Robot Actions into Pixel Trajectories
A joint research team introduced MaskedVisualActions, a pixel-space action interface that renders robot actions as pixel-level trajectories for video models to directly perceive. This approach boosts robot task success rates by up to 26 percentage points on the RoboCasa benchmark.
2026-07-22 ~ 2026-07-23 · 2 related posts
- A 15-hour video fine-tune turns masked trajectories into a robot control interface — Hadi Alzayer · 2026-07-22
- MaskedVisualActions turns robot motion into pixels and lifts RoboCasa success by up to 26 points — 机器之心 · 2026-07-23