AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities
Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu
cs.MM, cs.CV, cs.SD
2026-07-17
196 条音视频联动编辑指令测下来主流模型全不及格,保真度高分多是没改出来的;配套的 AVE-Agent 编辑意图 59.8,基线最高 42.4。
给一段真实视频做编辑,画面和声音是绑在一起的。改一个画面动作,配套的音效要跟着变;抹掉画面里的某个物体,它发出的声音也得一起删;改一句台词,口型要对上,背景环境音还得留住。现有的视频编辑评测要么只在无声片段上测画面变化,要么只测孤立的音频编辑,没人在测「画面和声音联动改」这种最常见的需求,也没测改完之后两路信号还协调不协调。AVE-Compass 就是补这个空白,顺手再揭穿一个被忽视的问题:不少模型的高分是靠「干脆不改」换来的。
基准部分有 145 条源视频、196 条音视频联动的编辑指令、2688 条细粒度检查项,覆盖 28 个细分子类。打分覆盖四个维度:指令遵循(IF,改对了没)、保真度(FP,没改的地方动没动)、真实感(REAL,像不像真的)、编辑意图(EI = IF × FP,既要改对又要保住无关内容)。打分靠 MLLM 按检查清单逐条判(原子化的「是/否」问题,还做了模态分离的三次独立调用以降低跨模态偏见),再配一套真实感评分准则,外加 7 个自动化指标(唇形同步、音画同步、画面美学、主体一致性、运动平滑度、音频美学、语音质量)。
最有价值的设计是「编辑响应」这一层。论文发现高保真度分经常是假的:模型干脆原样返回输入视频,没改的地方当然一点没动,FP 自然就高。于是他们单算一个响应率(目标模态到底改没改),再把 FP 和真实感只在「确实改过」的样本上重算一遍(门控 FP)。这一步把「不会改」和「改了但改坏了」彻底分开。
AVE-Agent 是配套提出的解法,三个 agent 串起来。Planner 先建场景画像,把复杂指令拆成有依赖关系的子任务 DAG,并主动补出指令没说但必然牵连的跨模态改动;Executor 把子任务分发到视频、音频、语音三条分支,每一步自检,不过关就按评估反馈重写指令、只留最高分的候选;Mixed Evaluator 最后检查整段合成结果,只做最小纠正(重混音、重生成某个子任务、或整体重规划),全局留最高分防止回退。
主表(MLLM 打分,满分 100):
| 模型 | 编辑意图 EI | 指令遵循 IF | 保真度 FP | 真实感 REAL |
| AVE-Agent (Wan) | 59.8 | 77.3 | 77.6 | 62.1 |
| Wan2.7 | 42.4 | 69.3 | 64.2 | 60.4 |
| HappyHorse | 41.3 | 66.9 | 63.9 | 63.0 |
| Gemini-Omni | 38.0 | 44.9 | 84.9 | 66.9 |
| Seedance | 26.6 | 37.4 | 81.7 | 69.2 |
| LTX2 | 15.2 | 70.1 | 30.6 | 64.1 |
AVE-Agent 的 EI 比最强基线高 17.4 分,是唯一能把指令遵循和保真度同时拉起来的系统。更能说明问题的是响应率:AVE-Agent 视频改了 92.7%、音频改了 94.4%;Gemini-Omni 音频只改了 22%,Seedance 视频只改了 69.1%——它们的保真度之所以高,是因为压根没动手。LTX2 走另一个极端,指令倒是听了,但基本等于把输入视频重生成一遍(保真度只有 30.6)。把自我反思重试拆掉 EI 掉 8.75,把提示增强拆掉再掉 7.76。自动化指标和 MLLM 打分的相关性普遍偏弱,人机一致度约 88% 到 93%。
对做音视频编辑的人来说,这篇给了一个明确的现状判断:跨模态联动编辑目前没有模型真正做好,单看画面或单看音频的分数都会误导你。最该立刻照搬的是「响应率 + 门控保真度」这套量法,任何评测音视频生成或编辑的流程都该先确认模型有没有真的改动目标模态,否则保真度分毫无意义。AVE-Agent 的「拆解 + 自检重试」框架是现成的便宜方案,模块化地挂在已有工具上,不重训模型就能把跨模态编辑效果拉上来一截。
规模小是作者自己承认的取舍。196 条指令是按评测成本倒推出来的:跑一遍单个模型要调闭源编辑 API 加 MLLM 打分,都按次计费。作者按 Seedance 官方定价估了一笔账,光视频生成就约 220 美元(196 条乘以平均 7.4 秒乘以每秒约 0.15 美元),加 MLLM 打分一个模型一次约 230 到 235 美元,还没算失败重试、存储和人工核验。这个量级很难拿来当日常评测跑。AVE-Agent 依赖的第三方工具行为会随版本变化,长期可复现性存疑。读下来还有一个论文没正面回答的点:门控 FP 依赖 MLLM 判「模态到底改没改」,而这项判定本身只有 88% 到 93% 的准确率,它的误差会不会反过来污染门控分,论文没有单独评估。