字节 FlowMimic 用模态模仿训练无 mask 视频编辑

ByteDance-Seed · hf · 2026-07-21

FlowMimic 想让视频编辑摆脱手工 mask

这篇来自字节跳动团队的工作尝试把图像/视频的生成与编辑能力整合到一个模型里。作者认为,现有视频编辑数据收集太依赖人工标注和复杂筛选,包括对象 mask、I2V/ControlNet 式合成、以及 VLM 过滤,导致任务类型窄、扩展性差。

方法要点

训练设计

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →