南开腾讯按镜头编辑长视频,跨镜一致性84.80、人工首选75.6%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

cs.CV, cs.MM

2026-08-27

南开与腾讯把多指令长视频按物理镜头拆开,用全局记忆卡和正负反馈编辑。跨镜一致性84.80,对标Seedance 2.0的77.58;用户研究75.6%排第一。

这篇在解决什么

现有视频编辑基本在 15 秒以内的单镜头短片上成立。真实成片更长,镜间切,实体稀疏出现,用户一次下多条异构指令。基线做法是按固定时长切块,把全部指令砸进每一块。狗只在最后 10 秒出现,前 15 秒仍被要求「给狗加帽子」,模型就会凭空造一只狗。各块独立编辑,身份对不齐;硬切边界还会闪、会乱时间线。

这篇把任务收成 MMLVE,三条硬约束。跨镜编辑一致性:改过的实体在所有出现过的镜头里长一个样。多指令解耦:指令互不串,实体不在的镜头不准幻觉。时空结构零破坏:没点名的背景、相机运动、镜头顺序必须留下。

方法

MMLVE-Agent 不切固定时长,按物理镜头想。PyDetect 切镜头边界。LLM 把用户提示拆成实体和指令,解开冲突、抽出时间条件。VLM 抽关键帧并做逐镜剧情分析。

跨镜靠一张全局记忆卡。VLM 按实体描述检索关键帧,取置信最高的 k=6 张拼成参考网格,生成该实体的原始参考图。图级正负编辑反馈(P-NEF)再核对:负向提示列要避开的伪影,正向提示钉住已经对的属性。只堆负向会把注意力拽去「别做什么」,已经改对的区域会被再改坏。循环直到验证通过或满 Tmax=3,失败则挑分最高的候选。参考图按用户指令改完,做成前后对照卡,作为后续视频编辑器的全局视觉锚。

真正改视频时按需触发。每镜对实体做三次投票,至少两票才编,否则原样保留。命中的镜头把原片、指令和对照卡交给视频编辑器 HappyHorse。视频级 P-NEF 再查两件事:指令是否执行,未编辑区域和运动是否保住。认知骨干是 Gemini 3.5 Flash,参考图用 Nano Banana 2。实验在 MacBook Pro M5 上跑,编辑模型走接口。

结果

MMLVE-Bench 从 UniVA-Bench 人工整理 25 条约一分钟的多镜成片,每条约 5 条 ADD/DELETE/MODIFY 指令,实体在时间上稀疏随机。三条主指标各拆 5 个 0/10/20 的子维,满分 100,评委是 Gemini 3.5 Flash。

方法CSECMIDZDSS平均
Seedance 2.077.5878.5882.2579.47
Kling o370.0072.5769.1370.57
HappyHorse 1.074.6867.2866.8869.61
MMLVE-Agent84.8079.0481.6881.84

CSEC 和 MID 领先。ZDSS 略低于 Seedance 的 82.25:论文写 Seedance 在复杂场选择保守、少改,结构分被抬高,漏改反映在更低的 CSEC/MID。Seedance 和 Kling 有 1–2 个场景因安全策略拒处理,这些场从它们的均值里剔除。定性例子里,基线会把「绿外星人」指令漏到无关人物上,或把后期镜头换成前期镜头。

用户研究 9 名熟悉视频生成的评审,每人 5 个案例,共 45 次盲排。MMLVE-Agent 第一名 75.6%,前二 93.3%,均秩 1.36,基线 2.63–3.16。对位胜率 87.6%,对 Seedance 88.4%、Kling 80.5%、HappyHorse 93.3%,Wilcoxon p<0.001。P-NEF 只有可视化消融,没有单独的分数表。

为什么重要

工程判断很清楚:长视频多指令编辑的主故障是切块方式,不是缺一个更强的 15 秒编辑器。按物理镜头定位、实体不在就跳过、先做一张前后对照卡再改视频,这三步可以直接接到现有 V2V 模型前面。HappyHorse 单独打分最弱,加上编排之后平均超过 Seedance 2.0,说明包装层在干活。

指标和智能体共享 Gemini 家族,人工排序是更可信的那一截。25 条成片太小,还不能当通用剪辑器声明。

局限与存疑

正文几乎没有独立的局限节。基准 25 条、每条约一分钟,指令由 VLM 提案再人工改,规模和覆盖都窄。评委和智能体都是 Gemini 3.5 Flash,自动分存在同族偏袒;用户研究样本量 45 也有限。HappyHorse 同时是骨干和最弱基线,增益里有多少来自反复调用同一编辑器、多少来自记忆卡,P-NEF 没有量化拆开。Seedance/Kling 的拒处理场从它们均值中剔除,对保守模型不公平的方向要说清楚。没有 CLIP/PSNR 之外、也不依赖 VLM 的像素级结构指标。实验写在消费级 Mac 上,复现取决于闭源接口。

术语

原文与代码

相关论文

全部论文解读