World in World: Training-free Flexible Control for Frozen Video World Models

The paper "World in World" introduces a training-free inference-time interface that gives frozen autoregressive video world models flexible camera and temporal control, such as re-staging and revisits, by routing heterogeneous visual evidence via native self-attention with correspondence-guided queries.

2026-09-11 ~ 2026-09-13 · 2 related posts