UCSD 提出 LIFT:用末帧布局控制未来画面,解决大视角变化视频生成
UCSanDiego · hf · 2026-09-30
UC San Diego 提出 LIFT,一个统一的图生视频框架:在相机控制之外引入 Layout-In-FuTure 控制,让用户指定未来视角中「什么该出现、出现在哪」,尤其针对大视角变化下首帧看不到的区域。现有相机控制只规定视点轨迹,文本提示只提供粗粒度语义,都无法精确决定未来视图的内容与空间布局。由于末帧稀疏布局比逐帧稠密布局更难学习,LIFT 引入在线策略自蒸馏(OPSD),把稠密布局教师的能力迁移到末帧布局学生;并构建含大视角变化、带相机与时间一致布局标注的 LIFT-Vista 数据集。实验显示 LIFT 在视频质量、未来布局可控性与相机可控性上均优于其他方法。
「多模态」频道最新
- 等生成间隙弹吉他,AI 视频团队拍出人机即兴合奏短片 — mrjonfinger · 2026-09-30
- Meta LSRM 获 ECCV 2026 最佳论文提名,稀疏注意力扩展 3D 重建 — rsasaki0109 · 2026-09-30
- Meta 实验室 LSRM 获 ECCV 2026 荣誉提名,3D 重建精度大幅超越 SOTA — rsasaki0109 · 2026-09-30
- NVIDIA 推出 LongLive-Plug:蒸馏一次即可复用于 54 个下游视频模型 — nvidia · 2026-09-30
- Adobe 研究:对抗训练后处理修复像素扩散模型的高频细节缺失 — adobe-research · 2026-09-30
- MiniMax-H3 RefMod 实战:打包 JPEG 缓存提速,角色串扰近乎消除 — acedelgado · 2026-09-30