Qwen-Video-Edit:图像编辑模型直接改视频,无需视频预训练骨干
qixing_huang · x · 2026-08-18
Qwen-Video-Edit 提出指令式视频编辑新思路:复用预训练图像编辑模型 Qwen-Image-Edit 的 DiT,直接在 Wan 2.1 的 video-VAE latent 空间上做编辑,无需任何视频预训练的 transformer。
- 方法:用两个很小的投影层把 Wan 2.1 latent 桥接进 DiT 的 token 空间,并从 DiT 自身的输入/输出层 warm-start,使静态视频的嵌入与图像完全一致;latent 帧被排布成一张大虚拟图的 tile,沿用图像预训练的位置编码(grid RoPE),prompt 由 Qwen2.5-VL 提供。
- 训练:在 Ditto-1M 的(源、编辑后、指令)三元组上做 LoRA 或全参数微调,最后用 Wan 2.2 的去噪增强做几步精修。
- 能力:支持长视频编辑(每 45 帧一段可用不同指令),人像视频原生支持且保持纵横比。
项目已放出代码与 Hugging Face 模型。
「多模态」频道最新
- MegaParts:通过高效自回归建模实现 300 部件 3D 生成 — Shanghai-AI-Laboratory · 2026-08-18
- 创意视频展示人脸与时间轴结合效果 — jh3yy · 2026-08-18
- AI 短片《DO NOT WAKE HER》展示视觉效果 — RealisticValuable484 · 2026-08-18
- 实测 MiniMax 角色替换功能:人换人、动物换动物可行 — Alex-edits123 · 2026-08-18
- Minimax H3 生成《Doomsday》预告片删减片段 — beatlepol · 2026-08-18
- 利用深度图与对象追踪稳定妻子模型的视频渲染 — alecubudulecu · 2026-08-18