Marigold V2 登场,改图像编辑模型实现指令式视频编辑
AntonObukhov1 · x · 2026-09-10
两条相关研究动态:
- Marigold V2(将亮相 SIGGRAPH Asia 2026):初代 Marigold 单卡 GPU 上把图像生成器后训练成深度估计器,V2 升级到扩散 Transformer(DiT)架构,边缘更锐利且更通用。
- Qwen-Video-Edit(Yunpeng Bai 等):不依赖视频预训练模型,直接让 Qwen-Image-Edit 这个图像编辑 DiT 编辑 video-VAE latents。方法是用两个小型投影把 Wan 2.1 latent 空间桥接到 DiT token 空间,latent 帧排成一个大虚拟图块的 tiles,配 grid RoPE;在 Ditto-1M(源视频、编辑后视频、指令)三元组上用 LoRA 或全参数微调,再用 Wan 2.2 做去噪增强。支持长视频分段多指令编辑与竖屏视频。作者称"把深度图变成能被 VAE 重建的 3 通道图像"是近两年最巧妙的技巧之一。
所属事件:Marigold V2 发布:单卡可训的 DiT 深度估计器(9 条相关)→
「多模态」频道最新
- Google Astra 视频去贴纸演示:模型精准移除成片中的杂物 — jxnlco · 2026-09-10
- Qwen 编码器换 INT8:画质与提示词遵循大幅回升 — cal_01 · 2026-09-10
- ImageGen + Hyper3D Rodin 打造可逐层拆解的 3D 擎天柱 — vista8 · 2026-09-10
- Flux 3 生成的哲思视频走红,作者附 I2V 提示词 — umesh_ai · 2026-09-10
- 网友给 AI 配上视频编辑器:7 分钟歌自动剪出成片 — Old-Age6220 · 2026-09-10
- AI 小猴打工人账号 just.monki 走红,全网可关注 — venturetwins · 2026-09-10