ID-V2V: Identity-Preserving Video Restylization
Yuancheng Xu, Mingming He, Pablo Salamanca, Li Ma, Yash Kant, Emmett Steven, Paul Debevec, Ning Yu
SIGGRAPH Asia 2026
cs.CV
2026-07-25
Netflix、Eyeline Labs、Adobe 的 ID-V2V(SIGGRAPH Asia 2026)做保身份视频改风格:把一张编辑过的首帧的风格、光照改动传播到整段视频,同时严格保住人脸相似度和表情、视线、唇形同步。关键是把保身份重新定义成视频重打光问题(只有光照可变),配合重打光人脸加法线图约束身份、编辑首帧加深度图驱动生成,这样只用单段视频就能造训练对。单、双人场景身份相似度 0.70、0.64,用户研究胜率 75%、86%。
视频内容创作里有个常见范式:先把人物表演拍下来,后期再设计视觉外观(背景、光照、风格)。生成式视频模型已经能合成高质量、时序连贯的视频,那能不能做到「忠实保住人物表演(表情、视线、唇形同步),同时灵活改视觉」?现有方法做不到:它们要么只用一两张参考图注入身份,拿不到真实表演的时序细节;要么用面部关键点或低维身份嵌入这类抽象控制信号,丢失微表情和唇同步。
更棘手的是没有配对训练数据:现实里很难拿到「同一个人做同样动作、但两种不同视觉风格」的两段视频。Netflix、Eyeline Labs、Adobe 的 ID-V2V 要同时解决建模和数据这两头。
核心是把任务拆成两个正交目标,并给一个关键观察。观察是:在保身份的改风格里,面部结构和表情应该不变,唯一允许变化的是光照。于是把「保身份」重新定义成视频重打光(video relighting)问题,把「改视觉」定义成由编辑首帧引导的条件式图生视频。
据此设计互补的控制信号:
这套设计的回报在数据上:重打光人脸、法线图、深度都能从同一段训练视频里直接导出,等于用单段视频就能合成配对监督,绕开了稀缺的真实配对。还做了 depth dropout,让模型在推理时可选地用深度,避免颜色偏色。
Table 1 在单人和双人改风格上和 AnimateAnyone、FantasyPortrait、VACE、WanAnimate、SteadyDancer 比:
| 指标(单人) | ID-V2V | 最强基线 |
| 身份相似度(AdaFace) | 0.701 | WanAnimate 0.529 |
| 表情相似度(EMOCA) | 0.899 | WanAnimate 0.841 |
| 用户研究(相似度/表演/质量胜率) | 75.0%/74.3%/70.1% | WanAnimate 10.5%/11.4%/12.6% |
双人场景身份相似度 0.637(基线 VACE 0.401、WanAnimate 0.432),用户研究胜率 85.6%/86.1%/81.1%。消融实验说明两个控制信号都关键:去掉 face video,身份相似度从 0.701 掉到 0.574。ID-V2V 在 VBench、VBench2.0 的通用视频质量上没掉,而专做人脸的基线从单人到多人会明显退化。
对做影视级数字人、虚拟制作、人本内容创作的团队,ID-V2V 给了一条实用路径:首帧编辑自动传播到整段视频,把表演捕捉和视觉设计解耦,现场不用搭最终布光和场景。把「保身份」形式化成重打光,既给出了清晰的约束(只有光照可变),又顺带解决了配对数据稀缺(单视频自监督)。多人物场景也能稳住每个人身份和互动,这是现有方法普遍拉胯的地方。
作者自己给了失败案例:源视频光照异常时效果会崩,说明重打光公式在极端原始光照下不稳健。用户研究虽然胜率高,但这是偏好投票,不是客观指标,样本量和评审背景论文没交代清楚。基线里没有纳入最新的、专门做保身份视频的强方法做统一对比,领先幅度可能被高估。表 1 的 VBench 类指标 ID-V2V 和基线差距很小,真正拉开差距的主要是身份和表情指标,通用画面质量上未必有明显优势。