CoinVE-Edit 发布:一次前向传播执行 5 条视频编辑指令

pmttyji · reddit · 2026-08-20

HuggingFace 上发布视频编辑模型 CoinVE-Edit,基于 Wan2.1-T2V-14B(DiT)与 Qwen3-VL-8B(MLLM 编码器)构建,支持组合式多指令视频编辑:单次前向传播同时处理 2–5 条编辑指令,每条指令通过轻量 mask 头注入区域感知引导,确保各编辑严格限制在对应空间区域内。

支持替换、添加、删除、更换背景等操作任意组合,同时保持整体视频连贯性。模型在 CoinVE-200K 数据集(20 万+ 高质量视频-编辑对,经严格数据过滤)上训练。

所属事件:腾讯 CoinVE-Edit 视频编辑模型与 CoinVE-200K 数据集亮相(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →