多参考音视频生成新基准

KlingTeam · hf · 2026-07-17

这篇工作提出 MultiRef-Compass,用于评估 多参考音视频生成(MR2AV)。

研究动机

现有基准更多关注:

但多参考音视频生成要求模型同时处理多个参考,并生成同步的音视频内容,因此更难。

基准设计

作者构建了一个包含 350 个样本 的统一基准,覆盖:

评测协议

定义了 4 个评测维度、共 14 个子指标:

并采用“自动指标 + rejudging 增强的 MLLM-as-a-Judge”框架,使评测更可扩展、也更可审计。

实验结论

在 8 个代表性 MR2AV 系统上,作者发现当前方法在多个维度上仍有明显提升空间,说明这个方向还远没有被解决。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →