UCSD 提出 LIFT:用末帧布局控制未来画面,解决大视角变化视频生成

UCSanDiego · hf · 2026-09-30

UC San Diego 提出 LIFT,一个统一的图生视频框架:在相机控制之外引入 Layout-In-FuTure 控制,让用户指定未来视角中「什么该出现、出现在哪」,尤其针对大视角变化下首帧看不到的区域。现有相机控制只规定视点轨迹,文本提示只提供粗粒度语义,都无法精确决定未来视图的内容与空间布局。由于末帧稀疏布局比逐帧稠密布局更难学习,LIFT 引入在线策略自蒸馏(OPSD),把稠密布局教师的能力迁移到末帧布局学生;并构建含大视角变化、带相机与时间一致布局标注的 LIFT-Vista 数据集。实验显示 LIFT 在视频质量、未来布局可控性与相机可控性上均优于其他方法。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →