先核对再打分,8B视频奖励模型整体MAE降到0.78

FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling

Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu, Xiaoxing Hu, Mingxin Liu, Shuran Ma, Yunhang Shen, Jian Hu, Haihan Gao, Haoyu Cao, Xue Yang

cs.CV

2026-08-22

按清单逐条核对视频证据后再聚合分数,蒸馏成8B端到端奖励模型。整体MAE从1.33降到0.78,三个生成器Best-of-8都最高。

这篇在解决什么

文生视频的奖励模型要同时看三件事:提示有没有被执行(Instruction Following)、世界是否自洽(World Coherence)、画面好不好看(Perceptual Quality)。现成做法多半是整段打分:固定量表,或让多模态模型自由写理由再给分。三类病会一起出现。检查不全,短暂动作、物体关系和局部瑕疵被滑过去。理由不可信,分数先出来、文字后补。归因缠在一起,同一处问题在语义、物理、观感上被罚三次。多阶段流水线更稳,但贵到没法当奖励模型用;端到端要快,又缺可验证的监督。

方法

FIRM-Video把「先核对、再打分」做成造数据管线,三条维度各有清单来源。

指令遵循:Qwen3-32B把提示拆成带1到5重要性的原子是否题,同一提示共享清单;多模态评估器逐条对着时序帧回答,不能从视频验证的算未满足,分数是重要性加权的满足比例。世界自洽:Qwen3-VL-235B先不看提示,抽出实体和动作并打重要性;再为每个目标生成关于结构、运动、物理的问题。提示只用来区分「故意的奇幻/风格」和「真的违规」。分数在目标级做干净比例再按重要性聚合,内容多的视频不会因为问题更多就被罚得更重。感知质量:人工整理的通用缺陷清单,提示只用来把风格化照明和渲染错误分开。

结构化核对结果再改写成自然语言分析,分数在写理由之前就定死。离线跑完这条贵管线,得到FIRM-Video-90K:29348条视频、3012条提示、88044条分维度样本,来自Rapidata和VideoFeedback2、二十余个生成器。训练时用Qwen3-VL-8B和InternVL3-8B全参微调两轮,每视频均匀采8帧,推理单次前向,不再调规划器、接地模型和核对器。

评测集FIRM-Video-Bench:250条视频、750条人工点分,与训练集无重叠,1到5分各档不超过30.4%。

结果

Qwen3-VL基座整体MAE 1.33,FIRM-Video-8B收到0.78,严格/放宽准确率0.42 / 0.84,三项都好过GPT-5(整体MAE 1.08)、Gemini-3.1-Pro(1.16)和Doubao-Seed-2.0-Lite(1.05)。指令遵循MAE 0.65,GPT-5仍是0.62更好;世界自洽0.86,是表上最低。InternVL3-8B变体整体MAE 0.85。离线造数管线本身整体MAE 0.73,学生没有完全蒸馏到老师。

MJ-Bench-Video偏好准确率上,InternVL3变体Alignment 31.93、C&C 35.35,总体31.06,接近Gemini-3.1-Pro的33.06。Best-of-8选片,Qwen变体在LaVie-Base、CogVideoX-2B、Wan2.1-T2V-1.3B上都拿到最高VBench Total / Quality / Semantic。相对次强选择器,Total分别+0.27 / +1.01 / +0.66,Semantic +1.24到+2.11。LaVie上N从2加到16,N≥4起持续领先,N=16比随机高1.03、比未微调Qwen3-VL高0.33。

为什么重要

奖励模型的上限往往是监督怎么造,不是学生有多大。清单、核对、再聚合,把多阶段评测压进一次8B前向,能当Best-of-N选择器,也能当以后RL的奖励。分维度打分让VBench这种拆开的基准可以对着相应轴去选,不必揉成一个总分。8B打过更大的闭源整体MAE,说明标注合同比模型规模更值钱。渐进工作:造数据贵、学生推理便宜。

局限与存疑

作者承认还没用这套奖励去直接优化生成器,Best-of-N和点分对齐不能代替RL闭环。视频中位时长3.3秒、多数1到6秒,提示中位27词,长镜头和复杂时间结构几乎没测。感知质量标注偏高分段,和当前生成器「看起来还行、偶发瑕疵」一致,也让PQ区分度变窄。造数依赖闭源多模态核对器和235B接地模型,复现成本高。MJ-Bench上Qwen变体Overall 27.81,并不全面领先。采样固定8帧,漏掉短动作的风险还在。

术语

原文与代码

相关论文

全部论文解读