OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation
Wenxue Li, Peiyan Guan, Haoyang Jiang, Junxian Cai, Hualuo Liu, Chunjie Zhang, Chong Guan, Songlian Li, Taiyi Wu, Yongjian Yu, Xiaotong Zhao, Alan Zhao, Eric Liu, Xi Chen, Yu Liu, Lei Zhu
cs.CV
2026-09-19
OmniVBench覆盖7族18类参考生视频,813题配12172条因子清单。Seedance 2.5总分72.68,开源MiniMax H3为72.41;内容参考更强,运动与叙事偏弱,因子路由仍是短板。
参考生视频已经从「一张人像保持身份」扩到动作、运镜、风格、线稿、分镜、故事续写,以及多参考拼在一起。现有基准仍偏内容参考,分数也多是整体像不像。Omni 场景真正难的是:该保的因子有没有保,不该跟过来的有没有剥开,指令有没有绑到对的对象上。
训练数据同样碎。OpenS2V、Phantom-Data 一类规模不小,但模态和任务覆盖窄,有的还不直接给处理好的参考–视频对。腾讯在线视频部加港科广用一套评测加一套 34 万样本,把这件事做成公共底板。
OmniVBench 按参考角色分成七个任务族、18 个细任务。单参考五族:内容(物体/角色/场景)、运动(动作与运镜)、风格、结构(灰盒、线稿、粗分镜)、叙事(多格分镜、故事、前一镜续写)。多参考两族:多内容组合,以及内容与运动/风格/结构/叙事的跨侧面组合。指令刻意不把应从参考推断的信息写进文本,避免模型靠读题抄作业。共 813 道题。
评分拆成三条,不再打一个「参考一致性」。参考保真(RF)看指定因子有没有转到生成视频;指令实现(IR)看因子有没有拆开并路由到正确目标、以及指令本身有没有落地;视频质量(VQ)用 DOVER++、Aesthetic Predictor V2.5 和 UnifiedReward 2.0,与参考无关。RF/IR 由人工核对过的 12,172 条案例清单驱动,Gemini 按条打分,RF 1–5、IR 三档,再分层等权汇总。
Omni-R2V 数据集约 339,570 条,片源以专业素材为主。配对两条路:跨片段匹配(同身份、同风格),以及从目标反推参考(抽线稿、生成简化结构)。指令由 Gemini 分条描述、DeepSeek 按任务规则写成训练提示,写明每条参考负责哪个因子。
闭源里 Seedance 2.5 总分 72.68,开源 MiniMax H3 72.41,两者几乎持平;后面是 Seedance 2.0 的 70.91、Happy Horse 1.0 的 70.89、Gemini Omni 的 70.76。开源第二名 Bernini 只有 56.95,开闭源差距在头部收窄,中腰仍大。
没有模型在所有任务族都强。内容普遍高于运动、风格、结构、叙事。IR 还能拆开:不少模型目标遵从高,因子拆开和路由低,多内容和跨侧面尤其明显,说明「按提示生成」和「把参考里不该要的东西丢掉」不是一回事。
| 模型 | 内容 | 运动 | 叙事 | 总分 |
| Seedance 2.5 | 78.88 | 66.10 | 73.97 | 72.68 |
| MiniMax H3 | 78.86 | 65.32 | 73.90 | 72.41 |
| Kling 3.0 Omni | 75.99 | 64.20 | 68.59 | 68.59 |
| Bernini | 69.27 | 55.92 | 42.02 | 56.95 |
| UniVideo | 66.01 | 44.52 | 36.97 | 49.69 |
100 题、965 个输出的人工对照上,自动分与人类的 Pearson 在 RF/IR/VQ 上分别是 0.81、0.78、0.86。因子清单的 Spearman 高于整体打分(RF 0.77 vs 0.67,IR 0.74 vs 0.69)。
做参考生视频的人现在有一张能把「抄错因子」打出来的表,而不只是 CLIP 式整体像。训练侧第一次把运动、风格、结构、叙事和多参考的处理好样本直接公开,省掉自己下原片再配对。对产品,内容参考已经相对能打,运镜与叙事、跨参考绑定仍是短板,不要只拿人物一致性演示当全能。
这篇主贡献是基准和数据,没有用 Omni-R2V 训出一个超过 Seedance 的新模型。分数能诊断,不能直接当生成器。
RF/IR 仍由 Gemini 按清单打,和人类相关高,但裁判模型本身会偏。训练片源以内部专业素材为主,和用户上传的短视频分布未必同。813 道题相对 34 万训练样本偏小,细任务上的方差不会小。Web 与其他平台的参考可见性、片长和分辨率分布也不均。论文没有报告在 Omni-R2V 上微调开源骨干后的增益,数据集的训练价值还是间接的。清单把因子拆开了,时序一致性、多镜头连续性仍可能被平均掉。