3964 段三元组数据集,教扩散模型把前景拆成带阴影反光的透明层

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

Kyujin Han, Seungjoo Shin, Sunghyun Cho

cs.CV

2026-07-28

提出三元组数据集 TriLayer(3964 段,含合成、背景、前景对齐)和双分支扩散 DBL-Diffusion,首次监督式学到带阴影反光的前景透明层,插入和分解两个任务用户都更偏好。

这篇在解决什么

视频编辑一直缺一样东西:明确的分层表示。往视频里插物体时,现有方法是在蒙版区域内隐式生成前景,容易带坏背景,也没有把物体引起的视觉效应(阴影、反光)单独算出来;做视频分层(把前景从背景抠出来)时,又缺前景层的监督信号,只能靠逐场景优化或隐式推断,泛化不行。这篇把这两件事放进一个框架,用一份带监督的新数据集同时解决。

方法

核心是一份叫 TriLayer 的数据集:3964 段视频三元组,每段都对齐了合成视频、干净背景视频、前景 RGBA 层(含阴影反光等视觉效应)。这是第一次能用「合成、背景、前景」的对应关系监督式学分层表示。基于此,作者提出 DBL-Diffusion(Dual-Branch Layered Diffusion,双分支分层扩散),两个分支:RGB 分支建模整场景外观,RGBA 分支预测带 alpha 通道的前景层。关键设计是每个 transformer 块里两分支做双向交叉注意力,互相 attend,保证前景和合成画面一致;训练上 RGB 分支用 LoRA(rank 128,域内),RGBA 分支用 DoRA(rank 32,处理透明和 alpha 这种域外概念),各分支用独立时间步采样平衡两种重建动态。底座是 Wan2.1-VACE-1.3B。落地成两个模型:DBL-Insert(给背景、文本、框,输出合成加前景层)和 DBL-Decompose(给合成视频,输出干净背景加前景层)。

结果

插入任务上,DBL-Insert 在背景一致性(0.946)、主体一致性(0.963)、CLIP-I(0.796)、DINO-I(0.747)等指标上都高于 VACE-Inp、ReVideo、AnyV2V。20 人参与的偏好测试里,DBL-Insert 整体被选 61.5%,VACE-Inp 只有 17.5%。分层任务上,它直接优化像素保真度不如 Omnimatte 系列(那些方法是逐场景优化的,PSNR 更高),但生成式地给出可信背景;用户偏好上前景质量 DBL-Decompose 拿 75.0%,Gen-Omnimatte 19.0%。

为什么重要

对做视频生成和编辑的人,这份三元组数据集本身就是个可复用资产,之前没有这种对齐监督。方法把「插物体」和「抠前景」统一到一个双分支扩散里,而且把阴影反光这些物理效应显式生成出来,意味着插完物体后期还能单独调前景层。这属于工程上扎实的渐进改进,不是颠覆。

局限与存疑

物体和场景之间复杂的物理交互、高动态运动还是处理不好。双分支架构带来额外算力和显存开销,作者说单次推理在 A100 80GB 上约一小时,离实时编辑差得远。分层任务的像素保真度输给逐场景优化的方法,在需要精确抠图的场景上要掂量。

术语

原文与代码

相关论文

全部论文解读