World in World 免训练为冻结视频世界模型赋予灵活控制

arXiv 论文《World in World》提出一种免训练的推理时接口,无需重训即可让冻结的自回归视频世界模型获得灵活的相机与时间控制,可实现重机位与回访等操作。其核心思路是将源视频观测、目标视角场景投影与引导信息结合,通过原生自注意力机制路由异构视觉证据,并借助对应引导查询实现精准控制。

2026-09-11 ~ 2026-09-13 · 2 条相关