FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei
cs.CV, cs.AI
2026-07-27
现有视频生成评测用网页提示词和通用模型打分,评不出电影级功力;FilmBench 由北京电影学院团队用获奖影片反推的提示词、按三层电影语言体系评测,自动排名与人类模型级相关性达 0.95,Seedance 2.0 居首。
视频生成模型越来越能产出「看着像那么回事」的画面,但评测还停留在很粗的层面:提示词大多从网页或 LLM 模板里抓,打分用没经过电影训练的通用多模态模型,评测维度也就是整体画质、文字对齐、时序平滑这种粗框。这些维度评得出「画面合不合理」,评不出「电影拍得好不好」。
FilmBench 的判断是:要评电影级生成,就得用电影人真正在用的电影语言(Cinematic Language)标准来评。
三个选择撑起这个基准。
提示词不从网页来,而是反向工程自获奖影片。专业导演(北京电影学院 + 湖镜影视)从 20 个电影类型里挑片段,用 FilmOps 算子配合 Gemini 3.1 Pro 反推叙事剧本和电影语言要素,再由导演团队精修成专业级提示词,带 @scene/@role/@prop 这种槽位标签,按真实分镜表走。多数提示词含多个镜头:T2V 515 条里 402 条是多镜头,R2V 654 条全是多镜头,合计 1169 条里 1056 条多镜头。这跟以往单镜头基准很不一样。
评测体系是三层:顶层 3 个轴(指令遵循、时序连续、美感质量),中层 12 个组件(R2V 多一个视觉跟随),底层 35(T2V)或 38(R2V)个子指标。每个子指标 1-5 分,线性映射到 0-100。
打分靠自研的专家级自动评测 agent,核心是把视频映射到结构化电影标签的 FilmOps 算子套件(覆盖景别、构图、视角、色调、人物布局、镜头运动六个维度,在 5000+ 部影视作品上训练),已开源。
自动排名和人类专家排名高度一致:模型级 Spearman ρ,T2V 达 0.95,R2V 达 0.96;13 个组件里 10 个 ρ≥0.78。
但绝对分数比以往的网页式基准低不少,而且暴露出两个一致的短板。一是「动态美感」差:色调与色彩得分最高(T2V 95.0),动作表现力最低(50.8),镜头运动表现力也低(54.8)。模型能渲染干净的单帧,动作和表演仍不可信。二是单镜头到多镜头的掉分:每个模型在多镜头提示词上都更低,平均掉 7.9 分,且越弱的模型掉得越狠(海螺 2.3 掉 22.8,Seedance 2.0 只掉 2.3)。
| T2V 模型 | 总分 | 多镜头掉分 |
| Seedance 2.0 | 88.93 | -2.3 |
| Kling 3.0 Omni | 86.32 | -5.5 |
| Veo 3.1 | 80.68 | -10.3 |
| Hailuo 2.3 | 68.94 | -22.8 |
完整榜上 HappyHorse 1.1 和 1.0 分列二三位,Kling 3.0、Vidu Q3 Pro、Grok Imagine Video 居中。三个轴里,指令遵循的跨模型方差最大(99.4),是美感质量(12.6)的近八倍、时序连续(5.6)的十七倍。模型之间的差距主要在「听不听得懂电影语言指令」,不在画面基本质量。方差最大的子指标也集中在镜头运动、焦点、景别、视角这些电影语言维度。
一个反直觉的发现:总分第一的 Seedance 2.0 只拿下 35 个子指标里的 18 个冠军,电影语言维度的冠军多被它包揽,但人物、音频、场景维度上 HappyHorse 1.1 拿了 11 个冠军。
对视频生成模型团队,这个基准把「电影感」从模糊的主观判断变成了可复现、与人类一致的指标,而且明确指出了现在的瓶颈不在画质、在动态表现和多镜头连贯。动作场景是重灾区:镜头运动维度在动作戏里掉 31.1 分,物理合理性、人物动作真实度也都明显下滑。这等于给后续优化画了靶子。
对选型的人,Spearman 0.95 意味着可以拿自动评测当人类评测的可靠代理,不必每改一个模型就请一遍导演。
作者只划了一条边界:FilmBench 评的是专业电影和影视内容创作能力,排名不代表模型在竖屏短视频、UGC 这类非电影场景下的表现。这其实是个挺重要的范围限制,它在电影维度上把模型排出高下,但日常生成场景里美感优先级和分镜逻辑完全不同。
读下来还有一点值得注意:虽然总体人类一致性强,但个别组件(剪辑 ρ=0.60、音频质量与连续性 ρ=0.68)的自动到人类一致性偏低,这些维度上的自动分数要打折看。