Qwen-Video-Edit:复用图像模型实现指令视频编辑
AgeNo5351 · reddit · 2026-08-24
核心机制
Qwen-Video-Edit 通过将 Qwen-Image-Edit 的 Transformer 适配到视频 VAE 潜空间,实现了指令式视频编辑。
技术细节
- 跨空间映射:使用两个微小的投影层将 Wan 2.1 的视频潜空间映射到 DiT 的 Token 空间,使静态视频帧像图像一样被模型理解。
- 排列处理:将视频潜空间帧排列为一张大虚拟图像的 Tile,沿用图像模型的预训练位置编码。
- 训练流程:先在 Ditto-1M 数据集(源视频、编辑后视频、指令三元组)上用 LoRA 或全参数微调,最后通过少量 Wan 2.2 去噪增强步骤精修。
可用性
项目已提供模型权重、代码和演示页面。
「多模态」频道最新
- Grok 展示视频剪辑能力,自动同步音乐 — XFreeze · 2026-08-24
- 电路板城市生成艺术 Demo 与开源代码分享 — jasonkneen · 2026-08-24
- 两阶段视频生成:剪辑 Latent 上传导致画面闪烁 — parth0202 · 2026-08-24
- MiniMax H3 配合 Ultimate SD Upscale 修复低分辨率生成 — alisitskii · 2026-08-24
- Kimi K3 生成深海探测仿生水母机器人设计 — mishig25 · 2026-08-24
- Minimax 视频角色替换工作流:绿幕虚拟人策略 — lhg31 · 2026-08-24