南大提出 AVE-Compass:专测音视频协同编辑的全新基准
NJU-LINK · hf · 2026-08-06
南京大学团队提出 AVE-Compass 基准,专门评估复杂的音视频协同编辑能力。现有基准多将音视频割裂评估,而该基准包含 145 个源视频、196 条音视频耦合编辑指令及 2688 个细粒度检查项,从指令遵循、保真度、真实感和编辑意图四个维度进行评测。
评测发现,当前最先进(SOTA)的模型在执行跨模态指令、保留非目标内容时依然困难。为此,团队还提出了 AVE-Agent 模块化智能体框架,通过将复杂指令分解为子任务,并结合自我反思与评估反馈迭代优化编辑结果,显著提升了联合编辑的指令执行度与音视频对齐效果。
「多模态」频道最新
- Seedance 2.5 视频生成实测:用 AI 留存温暖光影记忆 — eyishazyer · 2026-08-06
- 实测对比:MiniMax H3视频生成效果不及Veo 3与Seedance — yolaoheinz · 2026-08-06
- Midjourney 复古网点风创作指南:双情绪板提示词技巧 — _AustinCalvert_ · 2026-08-06
- 本地AI生成4分钟视频:尝试与挑战 — Then-Comfortable8258 · 2026-08-06
- 用 H3 生成伪纪录片奇幻短片:复杂镜头与长提示词实测 — Disastrous-Agency675 · 2026-08-06
- WISRD 基准测试:评估 AI 在纯图像空间解题能力 — HirokatuKataoka · 2026-08-06