字节 FlowMimic 用模态模仿训练无 mask 视频编辑
ByteDance-Seed · hf · 2026-07-21
FlowMimic 想让视频编辑摆脱手工 mask
这篇来自字节跳动团队的工作尝试把图像/视频的生成与编辑能力整合到一个模型里。作者认为,现有视频编辑数据收集太依赖人工标注和复杂筛选,包括对象 mask、I2V/ControlNet 式合成、以及 VLM 过滤,导致任务类型窄、扩展性差。
方法要点
- 提出一种 pixel-pair temporal warped flow field,可以从图像编辑样本实时生成对应的视频编辑样本。
- 设计 modality mimic 的生成损失和编辑损失,让图像与视频两种模态通过相互模仿来对齐能力分布。
- 对语言驱动的视觉编辑,重点逼模型同时学会:理解指令、定位区域、只修改目标区域。
训练设计
- 引入诸如 referring expression segmentation 之类的感知相关任务。
- 使用 编辑区域感知 的 latent-level loss 和 attention-level loss。
- 目标是让模型在推理时不再依赖额外 MLLM 或 mask 序列等外部辅助。
「多模态」频道最新
- Pablo Stanley 分享 ChatGPT 到 CapCut 的 AI 视频流程 — jdjohnson · 2026-07-21
- Meta AI 文本输入开始支持图文交错输入 — ezyang · 2026-07-21
- ShotPlan 用可学习规划 token 做多镜头电影感视频生成 — Tele-AI · 2026-07-21
- 同一提示词下,Seedance 2 与 Grok 的变身镜头对比 — LudovicCreator · 2026-07-21
- CG Chefs 展示复古动漫风格 AI 视频生成效果 — nicolascraske · 2026-07-21
- Seedance 2.0 夜店视频 demo 叠加时间码提示词和 4K 放大 — gen_ericai · 2026-07-21