TriLayer 视频分层模型:实现逼真的物体插入与图层分解

postech-cglab · hf · 2026-07-30

当前大多数视频编辑系统缺乏显式的分层视频表示,导致难以进行逼真的合成、物体复用和一致性操作。现有方法多依赖隐式推理或逐场景优化。

为解决这一限制,研究团队推出了 TriLayer,这是一个大规模三元组视频数据集,包含对齐的合成视频、背景视频和前景视频,且前景图层涵盖了物体外观及其相关的视觉特效。

基于该数据集,研究者提出了 DBL-Diffusion 双分支扩散框架。它通过共享去噪和跨分支交互,联合建模 RGB 合成图和 RGBA 前景图层。该框架包含两个具体应用:

实验证明,显式的图层建模显著提升了视频物体插入的保真度和图层分解的质量。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →