免训练给冻结视频世界模型加上灵活镜头与时间控制

Chenxi Song · hf · 2026-09-11

World in World 提出一个 training-free 接口,让冻结的自回归视频世界模型获得灵活的相机与时间控制:通过原生自注意力路由异构视觉证据,结合对应引导查询(correspondence-guided queries)与逐通道注意力引导实现,无需微调模型。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →