南大提出 AVE-Compass:专测音视频协同编辑的全新基准

NJU-LINK · hf · 2026-08-06

南京大学团队提出 AVE-Compass 基准,专门评估复杂的音视频协同编辑能力。现有基准多将音视频割裂评估,而该基准包含 145 个源视频、196 条音视频耦合编辑指令及 2688 个细粒度检查项,从指令遵循、保真度、真实感和编辑意图四个维度进行评测。

评测发现,当前最先进(SOTA)的模型在执行跨模态指令、保留非目标内容时依然困难。为此,团队还提出了 AVE-Agent 模块化智能体框架,通过将复杂指令分解为子任务,并结合自我反思与评估反馈迭代优化编辑结果,显著提升了联合编辑的指令执行度与音视频对齐效果。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →