多参考音视频生成新基准
KlingTeam · hf · 2026-07-17
这篇工作提出 MultiRef-Compass,用于评估 多参考音视频生成(MR2AV)。
研究动机
现有基准更多关注:
- 文本驱动生成
- 单参考主体保持
- 只看图像或音频/视频中的一部分一致性
但多参考音视频生成要求模型同时处理多个参考,并生成同步的音视频内容,因此更难。
基准设计
作者构建了一个包含 350 个样本 的统一基准,覆盖:
- 多视角主体保持
- 多实体绑定
- 人-物-场景组合
评测协议
定义了 4 个评测维度、共 14 个子指标:
- 基础质量
- 参考一致性
- 音视频一致性
- 指令遵循
并采用“自动指标 + rejudging 增强的 MLLM-as-a-Judge”框架,使评测更可扩展、也更可审计。
实验结论
在 8 个代表性 MR2AV 系统上,作者发现当前方法在多个维度上仍有明显提升空间,说明这个方向还远没有被解决。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11