让 MLLM 先想后剪:5B DiT 视频编辑反超 14B 基线

ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing

Donghao Zhou, Haoyang He, Fan Zhang, Hao Yang, Guisheng Liu, Xin Gao, Zhongwei Wan, Xingyuan Bu, Jie Wang, Qiangpeng Yang, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng

cs.CV

2026-09-30

CUHK 与字节把 MLLM 从语义编码器改成显式思考器,思维链驱动 5B DiT 编辑视频,两个 benchmark 的整体分都压过 14B 基线。

这篇在解决什么

真实用户剪视频,指令很少是「把 A 换成 B」这种直接描述。「删掉用来装这次野餐食物的容器」,模型得先推出那是野餐篮,才谈得上执行。现有指令视频编辑方法(OmniVideo、ICVE、OpenVE-Edit 等)把 MLLM 当语义编码器:联合编码指令和源视频,把特征塞给生成器。感知级对齐没问题,可一旦指令的真实意图藏在因果和上下文关系里,模型就抓表面关键词,改错对象、动错区域。论文的判断很直接:瓶颈不在生成质量,在缺一个「想清楚再剪」的环节。训练数据和 benchmark 也基本只考直接指令,是同一笔欠账。

方法

架构三段,外加一套训练推理配方。

训练走三阶段课程:480p 简单指令(OpenVE-HQ-1M,2 epochs)→720p 高清适配(0.5 epoch)→720p 复杂指令(ThinkV2V-150K,1.5 epochs),只训 connector 和 DiT。高分辨率和复杂指令一起上,时空对齐和推理执行会互相干扰,所以拆开学。推理时再叠一层:精化指令回灌 MLLM 做多轮串行精化,再由 MLLM 在 8 个候选里挑最贴合原意图的一个。只迭代不选择,早期误读会越滚越大。

数据从 OpenVE-3M 出发,留 5 个编辑类别,用 Gemini-2.5-Flash 打分加 CLIP-F、TF 两个时序指标过滤出 100 万高质量对,再挑 15 万对让 Gemini-2.5-Pro 把直接指令改写成推理型指令;ThinkV2V-Bench 用同一思路改写 OpenVE-Bench,得到 308 对。

结果

主表上,ThinkV2V 在 ThinkV2V-Bench 和 OpenVE-Bench、Seed-1.6-VL 与 Gemini-2.5-Pro 两个 judge 下 overall 全部第一,5B 的 DiT 压过 VACE 14B、DITTO 14B、ICVE 13B。不是全维度碾压:ThinkV2V-Bench 上 DITTO 的 Global Style 拿 3.28,高于 ThinkV2V 的 3.13,ReCo 在 Local Remove 上最强。收益也迁移到直接指令为主的 OpenVE-Bench,Local Change 和 Local Remove 两项尤其突出。

消融(Seed-1.6-VL 评判,overall 分):

配置Overall
MLLM 当静态编码器,不思考2.51
显式思考,喂全部 token 特征2.63
显式思考,只喂答案 token 特征2.68

只喂答案 token 更好,思考文本里的冗余被剔掉了。课程顺序对比:

训练数据安排Overall
只用复杂指令2.10
复杂→简单2.41
简单复杂混训2.47
只用简单指令2.52
简单→复杂(ThinkV2V)2.68

推理侧,串行精化单独用是 2.67,论文明确说没有带来提升;加上 best-of-8 选择升到 2.72。迭代推理本身不够,配上选择才有效。

为什么重要

第一,「reasoning 模型接扩散模型」的工程细节给得很全:hidden states 取哪段、connector 怎么设计、多条件怎么拼,做 MLLM-to-DiT 的人可以直接抄。第二,5B 赢 14B 支持了核心判断:编辑的短板在语义理解,不在生成容量,堆参数不如把理解环节做对。第三,best-of-N 不重训就能拿分,因为 MLLM 的显式文本输出可以被复用和筛选,这是把 MLLM 当编码器拿不到的红利。架构主体仍是 MLLM 加 DiT 的常见组合,真正的增量是把思考变成显式、可训练、可筛选的信号。扎实的系统级工作,算不上新范式。

局限与存疑

作者在附录 C 列了三条:显式思考推高训练和推理开销与延迟;思考内容本身的正确性没有独立评测,只看了最终编辑效果;数据和 benchmark 对长时程、开放域、稀有编辑场景覆盖不足。

读下来还有几处要打问号。训练集和 benchmark 的「隐式指令」全部由 Gemini 系模型改写生成,这个分布是否代表真实用户的说话方式,论文没有验证。评测完全依赖两个 MLLM judge 打分,没有人工评测,judge 对冗长改写的偏好可能被算进分数。ThinkV2V-Bench 只有 308 对,规模偏小。「5B」也只计 DiT,前面挂着 8B 的 MLLM,推理还有串行精化加 best-of-8,总账并不小。

术语

原文与代码

相关论文

全部论文解读