vivo 8B 剪辑规划器验证器回放蒸馏到 0.924,闭环追平 DeepSeek

Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing

Haoyu Wang, Cheng Feng, Liuyang Bian, Ruiyang Huang, Lei Wei, Yafei Wen, Xiaoxin Chen, Xiaoying Tang

EMNLP '26

cs.CV, cs.CL

2026-08-26

RefineCut 把成片剪辑做成带约束账本的可执行规划。验证器回放蒸馏把 8B 规划器 VES 从 0.620 提到 0.858,Evo 自改进到 0.924,同一闭环里追平 DeepSeek-V4-Pro。

这篇在解决什么

成片剪辑真正卡人的不是生成像素,是决策:片库里留哪些、怎么裁、怎么排、切点贴不贴鼓点、总时长能不能卡在 brief 里。这些约束是硬的,交付物是一份可执行时间线,渲染只是下游。

现有系统基本绕开了这一层。文生视频、图生视频改的是像素;指令编辑改的是单镜头内容。DIRECT、LVAS-Agent、GLANCE、StoryAgent、UniVA 这类工作流系统确实在做决策,但政策锁在提示词里的闭源大模型上,改不动,也对不上 brief 里的硬约束。缺的是一个能学、能查、能挂在任意渲染后端前面的开源规划器。

剪辑决策有一个像素生成没有的性质:输出可以检查。

方法

RefineCut 把任务写成五元组:自然语言 brief、带字幕和运动元数据的真实片库、可选音乐节拍、当前时间线状态、以及一份显式约束账本。账本覆盖时长、转场、音乐同步、必留/必删镜头、重复上限和节奏七类。规划器不看像素,只读上游视觉语言模型写好的字幕。

动作不是自由文本,是 RefinePatch:RFC 6902 风格的 JSON Patch,改的是类型化时间线。确定性验证器先 Apply 这一步补丁,再按账本逐条重算满不满足。硬约束全部通过叫 HardPass;软约束按比例给分,三个必留镜头留了两个,HardPass 失败,但必留召回记 2/3。

同一条 brief 可以有很多合法剪法,老师的第一选择不是标签。三家前沿 API(GPT-5.4、Qwen3-Max、DeepSeek-V4-Pro)各跑一轮,每步出多个候选分支。RefineCut 先把异构轨迹规范化,再让验证器回放每一个分支,留下打分最高的那条做 SFT,再用分差够大的分支做成步级和轨迹级偏好对,DPO 出 Mixed-Pref 8B(Qwen3-8B-Instruct 加 LoRA)。

第二阶段 RefineCut-Evo:学生在每个训练状态自己采 K=4 个补丁,用验证器分 V 和七条剪辑量规 ER1-ER7 的加权分 R 合成 S=0.65V+0.35R,只留分差超过阈值的高间隔对再做一轮 DPO。推理时规划器和验证器闭环最多 T=3 步,不再调老师。

蒸馏教它做出能执行的修改。Evo 教它把整份 brief 做完。

结果

主结果在 Common-100,同一套 PatchPlanner 提示、同一套冻结账本和验证器。协议内汇总指标叫 Video-Editing Score(VES),权重是 FinalCSR 0.30,HardPass、补丁可应用率、必留镜头召回各 0.15,时长通过和时线合法性各 0.10,无回退 0.05。

方法VESHardPass时长通过Converged@3
提示词基座0.5940.1500.6600.210
直接模仿老师0.6200.1600.4400.250
验证器回放 SFT0.8580.6300.8200.790
Mixed-Pref0.8640.6700.8300.800
RefineCut-Evo0.9240.8200.9800.950

回放蒸馏这一下从 0.620 拉到 0.858,训练集还更小:验证器筛过的 3,317 条对老师第一选择的 9,690 条。老师自己的验证器最优分支几乎都能 apply(PASR 0.87-0.99),但单步 HardPass 不超过 0.03。第一选择当标签会把噪声学进去。

Evo 再加 0.060 VES。100 道测试里 22 道变好、5 道变差、73 道不动,配对增益 +0.059(95% CI [0.028, 0.092])。消融里,验证器打分的 DPO 单独就能到 0.909,量规间隔再加 0.015,全收低分对会掉 0.027。

同一闭环里把老师当在线策略:GPT-5.4 的 VES 是 0.893,Qwen3-Max 0.773,DeepSeek-V4-Pro 0.936。8B 的 RefineCut-Evo 是 0.924,本地 11.7 秒/题,超过前两家,和第三家统计打平。同骨架上验证器反馈提示只能到 0.592,R=4 重排到 0.700,连访问过的状态里挑最好的 oracle 也只有 0.712。

回放增益在 Llama-3.1-8B(+0.153)和 GLM-4-9B(+0.079)上同方向,但偏好阶段只训了 Qwen3-8B,另外两家绝对分还在 0.65-0.69。canonical-clean(N=92,训练没见过同一 canonical id)上 Evo 0.917 对 Mixed-Pref 0.859;50 条外人写的 Human50 brief 上是 0.902 对 0.848。成片预览 150 对盲测,Evo 赢 Mixed-Pref 100、平 34、输 16,偏好 0.780。

为什么重要

这是把数学、代码那套「输出可检查」搬到创意决策层的一次认真尝试。对要做本地或私有化剪辑助手的人,含义很具体:8B 规划器可以本地跑闭环,不再每步打 GPT。代码和 RefineCut-Bench(3,578 题、7,971 条字幕镜头、499 条音乐)已公开。

它卖的是规划层,不是成片审美。验证器查的是账本和时长,查不了故事好不好听。VES 用的就是训练时那套验证器,所以它是协议内分数,不是独立画质分。能用的场景是片库加 brief 加硬约束,要一份能喂给剪辑工具链的时间线。像素生成、单镜头指令编辑,这篇没碰。

局限与存疑

规划器只读字幕和节拍,不看像素。上游 captioner 或 beat tracker 错了,计划质量就封顶。VES 和训练信号共用验证器,存在刷协议的空间。作者用成片盲测、计划统计(Evo 每题 1.76 个补丁,比提示词基座的 2.72 还少)和语义扰动来挡:打乱字幕会让 VES 掉 0.200、必留召回从 0.98 掉到 0.46,说明模型确实在读字幕,但没测过真实 captioner 出错时有多脆。

证据范围窄。8B-9B 三家骨架,偏好阶段只在 Qwen3-8B 上做完,Llama 和 GLM 验证器 SFT 之后绝对分明显低于 Qwen。RefineCut-Evo 是离线 DPO,不是在线 RL,也不是完整 EvoLM 复现。RefineCut-Bench 的 brief 和账本是模板约束下 LLM 生成的,Human50 只覆盖 50 条。更长成片、更多素材域、最终成片级评测都还没有。

主表 100 题、canonical-clean 92 题,样本量小。「追平 DeepSeek」是同一验证器闭环上的 VES:DeepSeek-V4-Pro 仍高 0.012,HardPass 是 0.89 对 0.82。四个更新的前沿策略在同一合同下做到 0.933-0.943,8B 还没过那一档。

术语

原文与代码

社区讨论

相关论文

全部论文解读