OmniVBench 发布:18 项细粒度任务评测全类型参考到视频生成
Wenxue Li · hf · 2026-09-21
新基准 OmniVBench 与配套的 Omni-R2V 数据集发布,针对「全参考到视频」(omni Reference-to-Video)生成这一新兴范式的评测与训练缺口。
基准设计:覆盖 7 大任务族、18 项细粒度任务,横跨内容、运动、风格、结构、叙事及多参考场景。引入基于因子的评测,含 12,172 条针对具体案例的 checklist 项,检验参考因子是否被忠实保留、正确解耦并绑定到目标、按指令正确呈现。
训练数据:Omni-R2V 数据集基于大规模专业视频素材,提供 34 万条处理后训练样本,覆盖多样参考类型与多参考组合,并为参考-目标对构建开发了可扩展的流水线。
结果:对先进开源与闭源 R2V 模型的评测显示,各任务族与评测维度间存在明显性能差距,暴露出当前模型的普遍短板。
「多模态」频道最新
- Qwen-Image-2.1 无审查 GGUF 量化版登上 Hugging Face 热榜 — abenzerps · 2026-09-21
- 自研 CUDA 兼容层让 Mac 跑图反超 RTX 5090,最快快 61% — LioDavinchy · 2026-09-21
- 实测 Qwen-Image-2.1:T2I 不敌 Krea2,编辑不如 Flux2Klein 灵活 — Capitan01R- · 2026-09-21
- Reddit 实测:Qwen 2.1 图像生成与编辑被称开源的 Nano Banana 时刻 — LongjumpingGur7623 · 2026-09-21
- GPT-Image 2.5 生成 4×4 像素图,Seedance 2.5 一键动画化 — Aiden_Tech_Ai · 2026-09-21
- Qwen-Image 2.1 上线 SGLang:单张 4090 18.7 秒生成图像 — Alibaba_Qwen · 2026-09-21