视频模型做过程推理,最强Seedance 2.0也只拿到51.0分

VGI-Bench: Probing Visual Intelligence in Video Generation Models

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

cs.CV, cs.AI

2026-08-20

VGI-Bench用27类共810道真实风格、过程敏感的视觉任务考视频生成模型。最强Seedance 2.0总分51.0;去噪后半程90.6%锁死早先假说,自我纠正低于1%。

这篇在解决什么

视频生成模型被越来越多人当成视觉世界模拟器,甚至希望它用生成的帧序列做零样本视觉推理。现有推理向基准常见三个坑:线稿、示意图和模型的自然图像先验差太远,失败分不清是推理不行还是域不匹配;很多题看第一帧就能答,并不要求把过程演出来;难度要么送分要么完全不可行,诊断价值低。

方法

VGI-Bench收了27类任务、约810个实例,两级标签:四个互斥领域(视觉组织、物理操作、结构化谜题、时空动态)加上可重叠的七个技能标签(空间、时间、规划、属性锚定、物理、拓扑、可供性)。输入是16:9真实风格图加文本约束,输出是把指定手续演完的视频。任务必须过程敏感:只看终局不够,中间轨迹还得守规则。

每类三个难度,预生成筛过:最易档至少被一个SOTA模型做对、也被至少一个做失败。评分两块相乘。Completeness由VLM judge按任务量规把视频标成完成/部分/失败;Rubric对逐条规则按1/(违规次数+1)衰减再平均。乘起来是为了同时惩罚「几乎静止但没犯规」和「终局看起来对但抄近路」。Judge是Gemini-3-Flash,自适应抽帧加滑动窗口,与人类偏好AUC 0.803、成对准确率73.2%。因成本只评每类一半实例。

结果

商业模型明显强于开源,但都远没做完。Seedance 2.0总分51.0,Kling 3.0为44.0,MiniMax-H3为44.4,Sora 2为36.7,Veo 3.1为32.0;HunyuanVideo 1.5和Wan 2.2只有19.1和21.6。结构化谜题最难,Seedance也只有44.6;视觉组织相对最好(60.8)。拓扑和时间是最弱技能维。

模型总分
Seedance 2.051.0
MiniMax-H344.4
Kling 3.044.0
Sora 236.7
Veo 3.132.0
Wan 2.221.6

失败模式反复出现:物理崩溃、规则被直接改结局绕开、物体身份中途漂移。Oracle提示能抬一些闭源模型,但即便把解法写进提示,完整轨迹也经常画不出来。开源模型对线稿输入更敏感。VBVR在百万级抽象数据上微调Wan 2.2,结构重叠任务+40.5,非重叠只+6.2,时间技能甚至下降。去噪轨迹上,自我纠正(错→对)全程低于1%,4→10步错改成另一种错占23.1%,后半程状态稳定率90.6%。后半步主要是把早先假说修细,不是纠错。

为什么重要

「视频模型会推理」目前只在一部分真实风格、短时程任务上成立,而且过程经常是假的。若要把生成器当视觉基础模型或世界模型,评测必须看轨迹合法性,不能只看最后一帧好不好看。合成数据微调能迁到结构相近的题,迁不出物理交互和强时间依赖。想在去噪过程里做自我纠正,现有开源模型几乎没发生。

局限与存疑

任务按当前模型常见的5到10秒时长来设计,更长装配或规划不在范围内。只测图生视频、16:9、英文提示。套件是代表性切片,不是穷尽。主表用半实例协议,附录声称和全量稳定,但仍是抽样。VLM judge与人类成对准确率73.2%,细规则上仍有噪声。图像改编分支只考静态终局,不能替代视频过程分。

术语

原文与代码

社区讨论

相关论文

全部论文解读