Sci-VBench:评估科学领域的视频生成与推理
Diandian Zhang · hf · 2026-08-11
Sci-VBench 是一个用于评估科学领域知识密集型和推理密集型视频生成的综合基准。
- 基准构成:包含 1,253 个专家标注样本,横跨自然科学、医疗保健、人文社科和工程学四大学科的 60 个科目。要求模型生成具备科学推理和知识基础的时间连贯视频,超越表面的视觉合理性。
- 评估协议:建立了基于评分标准 的评估协议。非专家人类评估者和 MLLM-as-Judge 系统均能与专家判断达成较高一致性,支持大规模可复现评估。
- 模型实测:对 16 个前沿闭源与开源模型进行基准测试发现,尽管感知质量得分相近,但在“提示词落地”和“科学因果正确性”上差异巨大,且闭源模型明显优于开源模型。这表明视觉真实度的提升尚未转化为对科学动态的可靠建模。
「多模态」频道最新
- AI 视频翻车名场面:用 AI 让芝麻街重现《迈阿密风云》经典桥段 — dreamwieber · 2026-08-11
- Grok Image 2.0 实测:精准局部编辑与文字渲染 — minchoi · 2026-08-11
- AI生成10分钟长片爆火,单日播放破30万 — ZabihullahAtal · 2026-08-11
- MiniMax M3 实测:不到 5 分钟生成高质量视频 — Fear_ltself · 2026-08-11
- 北大提出RefCaptioner:精准实现多参考图与视频语义绑定 — 机器之心 · 2026-08-11
- 一笔触变化:AI视频工具将食材变拉面 — SimplyAnnisa · 2026-08-11