Sci-VBench:科学视频生成画质已饱和,科学与因果对不对才是模型分水岭

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

COLM 2026

cs.CV, cs.AI

2026-08-11

1253 条跨 60 学科的科学视频题配专家评分细则。16 个模型画质分几乎贴平(3.79 至 4.12),但科学与因果正确度从 1.24 到 3.34,闭源远甩开源。

这篇在解决什么

视频生成模型这两年在画面清晰度、运动连贯性、可控性上进步很快,问题从「像不像」转向「对不对」。在科学场景里这个落差尤其致命:一段视频可以看着完全没问题,却违反守恒律、把因果关系搞反、或展示一个物理上不可能的状态转换。现有基准要么只评感知质量和提示对齐,要么只考通用的物理常识,缺一个跨学科、且把专家评判标准做成可移植的基准。

方法

Sci-VBench 有 1253 条专家标注的例子,横跨自然科学、医疗、人文社科、工程四大学科下的 60 个子学科,由 61 位专家(11 位本科、45 位研究生、5 位作者)按教材指引的流程写。每条只给出可观察的初始布置和干预,故意不写预期的机制轨迹,逼模型自己从布置推断机制。

每条配一份评测规范:一份高层参考指引(点明目标概念、所需的最小机制假设、按阶段描述预期现象),加一份每个维度 1 到 5 分锚点的评分细则。四个评测维度是:低层感知保真度(画面质感)、提示接地(视频是否忠实呈现提示里明说的条件)、科学与因果正确性(动态是否符合领域知识与因果机制)、时空一致性(时间演化和空间关系是否连贯)。

评测协议是关键贡献。专家人工打分当参考标签(专家间 Cohen κ=0.842)。自动评测里,感知保真度用 VBench 的视觉工具,其余三维用带评分细则的多模态判官(Qwen3.5-397B-A17B)。他们做了一项对照:把评测规范给非专家,其在提示接地、科学因果、时空一致性上跟专家的相关大幅上升(比如科学因果从 0.682 升到 0.825),带上规范的非专家比任何多模态判官都更贴近专家。

结果

16 个模型(8 个闭源、8 个开源)在 150 条的 testmini 上测。最重要的发现是:分水岭在机制,不在外观。感知保真度的自动分在所有 16 个模型上几乎贴平(3.79 到 4.12),但科学与因果正确度的自动分从 1.24 拉到 3.34,人工分从 1.12 到 3.06。

闭源跟开源的差距集中在推理维度。Gemini-Omni-Flash 最强(自动 3.38、人工 3.18),其后是 HappyHorse-1.1 和 Seedance-2.0,都超过了更早的 Veo-3.1、Sora-2。开源组最强的 MiniMax-H3 在科学与因果正确度上只有 1.63,不到闭源最强的一半。但在时空一致性上开源并不落后,Wan2.2-5B 甚至拿到全表最高的 2.79。没有哪个模型在所有学科上都最强:Gemini-Omni-Flash 在四个学科里领先三个,医疗却是 Sora-2 最好。

作者还测了提示改写:把提示用 Gemini-3-Flash 改得更具体,科学与因果正确度提升最大(开源模型 +23% 到 +52%),时空一致性提升最小,说明很多时间上的失败是生成器本身的局限,不是提示没写清。

为什么重要

对做视频生成的人来说,这篇给了一个明确信号:像素层面的竞赛基本到头了(感知分贴在一起),真正的差距在模型懂不懂背后的科学机制。闭源在推理维度甩开开源一大截,说明科学知识接地和因果建模是开源模型该补的短板。带评分细则的评测协议也实用:让非专家或自动判官能按同一把尺子打分,不用每次都请领域专家,这对大规模可复现评测是实打实的帮助。

局限与存疑

闭源模型只在 150 条的 testmini 上跑(全量跑商业 API 太贵),所以闭源的排名是低成本抽样,跟全量可能有出入。多模态判官在感知保真度和时空一致性这类细粒度视觉或时间瑕疵上跟专家对齐最弱。60 个学科分布不均,人文社科只占 8.2%(103 条),代表性偏窄。提供方过滤掉了 6 条 Gemini-Omni-Flash 和 2 条 Seedance 的提示,相关平均只用成功生成的样本算,略有偏置。视频生成迭代极快,这里的模型版本只是一个时点快照。

术语

原文与代码

相关论文

全部论文解读