Streaming Video Editing with Easy Adaptation
Yujia Hu, Jiajun Li, Zihao He, Songhua Liu
cs.CV
2026-09-21
上海交大提出 SVEET:只在冻结的双向视频扩散模型上训控制支路,用逐帧 2D 注意力加正交解耦,零样本接到流式骨干,单卡 H100 达 15 FPS。
视频扩散正在从离线整段生成,转向按块往外吐的流式生成。直播风格迁移、在线补全、实时数字人,都要求当前帧不能等未来帧。现有视频编辑大多建在双向 DiT 上:整段一起去噪,时序注意力跨过去、现在、未来。这和流式约束对着干。
最直的路是按流式目标重训编辑模型,或像 Self Forcing、Causal Forcing 那样做流式蒸馏。论文给出的量级是约 128 个 H100 GPU 天,外加数千对 ODE 轨迹;再叠控制信号,更贵。SVEET 问的是另一件事:能不能只在已经训好的双向模型上学习控制,再把这套控制零样本接到现成的流式骨干上,流式侧一个参数都不动。
对照实验先筛出两条原则。Wan-Fun 那种会改骨干权重的接法,迁到流式几乎垮掉;VACE 式独立控制支路好一些;把控制支路的时空 3D 注意力改成逐帧 2D,迁移更稳。于是有两条硬约束:骨干特征要和编辑控制解开,源视频编码不能带跨帧依赖。
SVEET 按这个搭。双向骨干用冻结的 Wan2.1-1.3B-VACE。控制支路编码源视频,但 self-attention 只允许同一帧内部的空间 token 互看,跨帧 mask 全关。生成视频的时间连贯性交给流式骨干自己的 KV cache。控制支路因此不必再维护一份时序 cache,流式推理时几乎不增加额外的 cache 增长。
只换注意力还不够。双向模型和因果模型的中间特征对不齐,控制信号直接灌进去会漂。Orthogonal Decoupled Training(ODT,正交解耦训练)专门对付这件事:
LoRA rank 是 128。每个任务单独训一条控制支路,10 个 epoch,单张 A100 80GB,batch size 1,81 帧、480×832。流式默认骨干是 Causal Forcing;附录里同一条控制支路也能接到 Self Forcing 上出图。
测试集:风格迁移 120 条(Ditto 留出),补全和深度生成各 80 条(VPData)。评判三套:GPT-4o 打 1–10 的编辑准确度、CLIP-T 文本对齐、VBench 六项。
| 任务 | SVEET VLM | 最强公开基线 | 3D VACE 对照 |
| 风格迁移 | 7.43 | LiveEdit 5.87 | 7.07 |
| 视频补全 | 8.47 | LiveEdit 7.78 | 8.06 |
| 深度生成 | 8.41 | Daydream+CF 7.15 | 5.75 |
风格迁移上 CLIP-T 是 0.229,和 LiveEdit 的 0.228 几乎持平,主体一致性 0.945 对 LiveEdit 的 0.928。深度生成上 VLM 分差最大:3D 注意力的 VACE 变体只有 5.75,SVEET 到 8.41,说明跨帧条件在这个任务上特别伤迁移。
消融(风格迁移 VLM):3D 无 ODT 7.07,2D 无 ODT 7.19,3D 加 ODT 7.33,2D 加 ODT 7.43。推理阶段事后投影掉到 6.43;两阶段 teacher forcing 要 7.09,还得改流式骨干。10 人、15 条视频的用户评分:编辑正确性 9.08,结构保持 9.21,流畅度 8.11,三项都高于 Daydream+CF(7.85 / 8.62 / 7.95)。单卡 H100、不加额外加速,15 FPS。
给已经有双向编辑模型和流式生成模型的团队,这是一条便宜的接法。控制支路在一张 A100 上按任务训 10 个 epoch,流式骨干冻结,省掉那 128 H100 天的蒸馏。直播风格化、在线补洞、深度驱动生成,理论上可以共用同一套迁移逻辑。代码已公开。
它不是新的生成骨干,也不是统一多任务编辑器。三条任务各自一条 LoRA。质量上限仍由 1.3B 的 Wan-VACE 决定。对要上线流式编辑、又不想重蒸骨干的人,这是工程上能立刻试的渐进方案。
作者自己写了两点:能力绑在底层双向编辑模型上;更广的编辑任务和更异构的骨干还没铺开。评测分辨率停在 480×832、81 帧,1.3B,没有和 14B 级骨干对照。15 FPS 没有并列报告各基线在同一张 H100 上的帧率,速度优势只能当自我测量。GPT-4o 当裁判,和「编辑准不准」相关,但不是人类金标准;用户研究只有 10 人、15 条视频。深度生成表里 Channel Concat 和 Daydream+CF 多列数字完全相同,很像贴错行,那一格不宜当真。校准用的 ridge 加 SVD 假设特征差距低秩,换一套流式骨干要重算投影器。