ZimaBlue: Evolving Generalizable World Action Models via Video Pre-training

JoyFutureAcademy · hf · 2026-09-02

ZimaBlue learns generalizable world action models from large-scale egocentric video via a three-stage curriculum and a slow-fast architecture. It substantially improves zero-shot robotic manipulation by leveraging video data to understand physical world interactions.

Original post →

More from Embodied

Embodied channel →