Netflix 的 ID-V2V 从单段视频保持身份并重风格化
netflix · hf · 2026-07-28
Netflix 研究团队提出 ID-V2V,一个面向 身份保持视频重风格化 的视频到视频生成框架。
- 目标是在把场景、光照和风格从编辑后的关键帧传播到整段视频时,尽量保住人物的脸部相似度、表情、视线和口型同步。
- 难点在于真实世界几乎没有配对训练数据,所以作者尝试从单段视频中构造训练对。
- 方法核心是把 身份保持 和 编辑驱动的生成 解耦:脸部身份通过类似重打光的方式约束,风格与内容扩散则由编辑关键帧和深度序列控制。
- 具体控制信号包括:重打光后的脸部区域、脸部法线图、编辑后的关键帧和深度序列。
- 作者称它在单人和多人场景下都能更好地保留脸部相似度与细粒度表演,并已开源代码。
「多模态」频道最新
- dRAE 将视觉离散化扩到 13.1 万 token,避免 codebook 崩塌 — burny_tech · 2026-07-28
- 新论文给出原生多模态预训练的最优缩放规律 — burny_tech · 2026-07-28
- 新 ComfyUI 节点可把音频转成 MIDI — MuziqueComfyUI · 2026-07-28
- Boogu-Image-0.1 用 2.08 亿图像和 40 万美元冲到开源前列 — 机器之心 · 2026-07-28
- ComfyUI 基础概念探讨:为何工作流要拆分 Checkpoint 与 KSampler? — DavidThi303 · 2026-07-28
- RTX 4060 跑 Z Image Turbo 出图:如何突破画质上限? — Dangerous_Ring_435 · 2026-07-28