一条视频同时执行五条编辑指令,腾讯开源 20 万组训练数据

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu

cs.CV

2026-08-18

腾讯开源 20 万组组合式视频编辑数据(每条 prompt 含 2-5 个原子操作),配套 22B 模型范围准确率 89.45,超 Seedance 2.0 1.74 分。

这篇在解决什么

视频编辑模型已经能听懂「把背景换成森林」这类单一指令,但真实需求几乎总是复合的:换衬衫、摘帽子、在领口别一副墨镜、把墙改成油画风,四件事要在同一段视频里一次做完。训练数据撑不起这个能力:现有指令式编辑数据集的指令短、只含一个主要编辑意图,编辑对象多限于单一主体,也没有把增、删、改、风格化组合起来的系统标注。模型遇到多指令输入就漏做、改错区域,或者把局部风格化泄漏成全片滤镜。

腾讯这支团队补上这块:CoinVE-200K,20 万组「源视频+编辑后视频」对,全部 1080p、81-201 帧,每条 prompt 由 2-5 个原子编辑操作组成,平均 2.55 个,平均编辑质量分 4.85(5 分制)。数据集、评测基准 CoinVE-Bench、22B 基线模型 CoinVE-Edit 一起开源。

方法

数据不是人标的,是一条生成管线造出来的,分三步。

CoinVE-Edit 用 Qwen3-VL-8B-Instruct 理解视频与多条指令,Wan2.1-T2V-14B 做生成底座,合计 22B。关键在两个轻量头:Mask Predictor 从 MLLM 的视觉 token 预测每条指令的时空掩码,回答「在哪改」;GateNet 判断该指令是局部编辑还是全局风格化,回答「区域约束该不该生效」。注入侧不用硬掩码去掰注意力,而是给每个 cross-attention 块包一层 Q-Blending:编辑区内权重为 1,局部编辑的区外软衰减到 0.7(β=0.3),全局编辑整帧生效,多条指令的输出按权重求和。硬掩码会扰动预训练底座的特征分布,软调制不往 DiT 里加任何新参数,消融结果也支持这个取舍。

训练分三阶段:先用 200 万对图像编辑数据(经 EditScore>8 筛选)对齐 MLLM 与 DiT 的特征空间,再混图像与视频数据练单指令编辑,最后只用 CoinVE-200K 练组合编辑;Mask Predictor 与 GateNet 先离线练稳(掩码 IoU 0.71、门控准确率 0.95),再全模型端到端。全程 32 张 H200。

结果

CoinVE-Bench 用 361 条与训练集严格不相交的视频,11 项指标分 MLLM 清单评测与专项评测器两组。核心对比:

模型语义准确 SA范围准确 SPA编辑持续 EP运动自然 MN内容保留 CP
CoinVE-Edit(22B,开源)87.9789.4589.6095.3090.83
Seedance 2.0(闭源)85.3487.7188.0892.8793.91
Kling O3(闭源)86.9180.9389.0693.9184.51
SAMA(开源)75.5873.3579.6388.1490.08

编辑准确性三项全部领先,范围准确 SPA 比最强对手 Seedance 2.0 高 1.74 分。代价在视觉质量:美学分 4.13,低于 Seedance 2.0 的 4.47 与 Kling O3 的 4.49;尺度一致性与内容保留也不及 Seedance。单指令场景(OpenVE-Bench,Gemini 2.5 Pro 打分)总体 3.41,开源方法里最高,仍低于闭源 Runway 的 3.51。

消融把两个设计拆开验证:去掉掩码与 Q-Blending、把多条指令拼成一条长 prompt,SA 从 87.97 掉到 82.61;换成硬掩码偏置,SA 83.35,尺度与运动自然度还反向受损。

定性结果里有两个案例最能说明问题。多数 MLLM 编辑模型会把「在衬衫领口别一副墨镜」执行成「戴上墨镜」,因为训练数据里墨镜长在脸上;CoinVE-Edit 先定位再生成,放对了位置。删除牛仔帽时,镜子里的倒影也一并消失,说明 Mask Predictor 捕捉到的不只主编辑区,还有受牵连的次生区域。

为什么重要

用户的编辑需求天然是复合的,组合编辑是这类工具从演示走向生产的缺口。此前这个方向没有规模化训练数据,闭源模型也做不稳:论文例子里,前沿模型把局部油画风指令泄漏成全局滤镜,Seedance 2.0 还往空碗里凭空添了红豆。CoinVE-200K 把数据、基准、开放权重基线一次配齐,后续工作有了可比的起点。掩码监督加软性注意力路由这套做法也不限于视频,任何「多条指令作用于不同区域」的生成任务都能借鉴。

局限与存疑

作者自认的边界:没覆盖参考图引导编辑、细粒度运动编辑、复杂运镜控制,长视频和高互动场景的组合编辑仍然吃力。

读下来还有几处存疑。数据是合成的,编辑后视频出自 Wan2.2-Animate/VACE 与图像编辑模型,「真值」本身带着生成模型的上限,Gemini 过滤筛得掉明显失败,筛不掉系统性的合成痕迹;拿 Wan 系底座训练 Wan 系产物,同源偏差可能被放大。基准自建,评委是 Gemini 3.6 Flash,训练数据又经 Gemini 2.5 Pro 过滤,同一族模型既筛了训练集又当裁判,方向性结论可信,具体分差别过度解读。Mask Predictor 的 IoU 0.71 意味着近三成定位误差要靠 Q-Blending 的软衰减兜底,重遮挡场景是否失效没有单独分析。全篇没有人工评估。

术语

原文与代码

相关论文

全部论文解读