VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation
Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu
cs.CV
2026-08-19
复旦用约一万对人类音画偏好训出VA-Judger奖励模型,对齐准确率68.4%;拿它后训练LTX-2,两百条三选一人选定62%,拼指标的OmniNFT只有27.6%。
联合音画生成已经能在一次前向里同时出画面和同步声音。下一步是用强化学习做后训练,把结果往人觉得好的方向推。卡点是奖励。
现成做法以 OmniNFT 为代表:VideoAlign 和 HPSv3 管画面,Audiobox Aesthetics 管声音,CLAP 管声文对齐,DeSync / SynchFormer 管时间同步,几个分数加权拼成奖励。人看一段带声视频,依据是文、画、声、动作、语义是不是同一件事。同步分高但事件错了、画面漂亮但情绪对不上、各项指标都过关但整体别扭,都会发生。把这些单指标拿来两两选赢家,总体准确率只有 50.43% 到 56.88%,没有一项超过 56.88%。拿这种奖励优化,模型会刷指标、对人发虚。图像侧的 ImageReward、视频侧的 VideoReward 都听不到声音;纯音频指标又看不到画面。把两边分数加起来,跨模态交互补不回来。
复旦、上海创智学院和阴旺智能做了三件事:偏好数据、跨模态裁判、拿裁判去后训练生成器。
数据叫 VAPref-10K。从 YouTube、B 站、电影和剧集收了 10173 条真实音画,剪成 5–10 秒,分成六类:多人对话、旁白、音乐、电影氛围、环境事件、讲话。Qwen3.5-Omni 先出带时间戳的稠密描述,再用 Qwen 改写成可生成的 prompt,留下 10083 条。候选片段由开源模型 OVI、LTX-2、DaVinci-MagiHuman 生成。标注不做绝对打分:同一 prompt 的两段比一对,选出更好的,并勾出支撑判断的质量维度。
配对按难度拆。easy 池 4.4K 对,主要是 OVI 对 LTX-2(对话和旁白再加 DaVinci-MagiHuman),质量差大、胜负清楚。hard 池原始 9.8K 对,多数是同一模型、同一 prompt、不同随机种子,只能抠细微音画差。汇总约 9K 条 prompt、10.3K 组成对比较。
裁判 VA-Judger 从 Qwen3-Omni-30B-A3B-Instruct 起步,视觉和音频编码器冻结,只训语言骨干。输入是固定评分量表、一条文本 prompt、两段带声视频。模型给每段在五个维度上打 1–10 分并写短理由,再汇总总分,最后用 <answer>video k is better</answer> 收口。五维分别是:(A) prompt 对齐,(B) 音画一致,(C) 音频质量,(D) 视频质量,(E) 完整与连贯。
训练分三阶段。
评测基准 VA-Judger-Bench 共 1150 对:easy 400、域内 hard 250、域外 500。域外来自 AVGenBench,拿 Kling 2.6、Wan 2.6、Veo 3.1 Fast / Quality、Sora 2 互相比,训练时没见过。
后训练拿 19B 的 LTX-2 当策略,沿用 OmniNFT 的强化学习框架,把五个独立专家奖励换成 VA-Judger。每个 prompt 生成 8 个候选、组成 28 对。C 维当音频奖励,D 维当视频奖励,A / B / E 平均当跨模态共享奖励。骨干冻结,只训 LoRA。
先看裁判准不准。
| 方法 | Easy | 域内 | 域外 | 总体 |
| Javis Score(最好的单指标) | 60.00 | 55.51 | 54.96 | 56.88 |
| Qwen3-Omni Instruct CoT | 63.25 | 54.80 | 55.00 | 57.83 |
| Easy SFT | 72.00 | 59.20 | 56.20 | 62.35 |
| Hard SFT | 74.50 | 63.60 | 60.20 | 65.91 |
| GRPO(VA-Judger) | 76.25 | 66.00 | 63.40 | 68.43 |
单指标整体停在 50.43%–56.88%。VideoAlign 和 AudioBox 在 easy 上还能到 62.39% 和 58.70%,域外掉到 48.35% 和 44.00%:单模态在大质量差上偶尔能猜,难例和闭源模型上不行。三阶段逐步加分,最终比 Qwen3-Omni CoT 高 10.60 个百分点。
再看拿它后训练 LTX-2。评测是 JavisBench 随机 200 条 prompt。
| 方法 | 视觉质量 VQ | 运动 MQ | 音频 AQ | JavisScore | AVHScore | 文声对齐 |
| LTX-2 | 2.248 | 0.697 | 4.767 | 0.074 | 0.091 | 0.105 |
| OmniNFT | 3.727 | 0.947 | 5.399 | 0.122 | 0.146 | 0.133 |
| VA-Judger | 3.942 | 1.183 | 5.610 | 0.230 | 0.261 | 0.180 |
13 项 JavisBench 指标里拿了 11 项第一,7 项补充指标里拿了 6 项。DeSync(越低越好)走了反方向:基座 0.430,OmniNFT 0.226,VA-Judger 后训练 0.592。OmniNFT 专门优化同步指标,人并不买账。
20 名受试者对这 200 条做三选一:VA-Judger 后训练拿 62.30% 人票,OmniNFT 27.63%,基座 LTX-2 10.08%。大约是 OmniNFT 的两倍、基座的六倍。
音画联合生成的强化学习后训练,缺的是能看完整文-画-声体验的奖励,不是再叠一个同步分数。VA-Judger 把路径从「拼开源指标」改成「人类成对偏好加可解释量表」,并且换奖励之后人真能看出来。
已经在跑 OmniNFT 一类流程的团队,最直接的用法是把奖励头换成这个裁判,代码已开源。不要把它当万能评测器:域外 63.40% 说明闭源模型之间的细微差别,它还经常判错。
这是渐进工作。新意在数据、由易到难的微调和把 GRPO 奖励拆到人指定的维度,组合大于单点新模块。但「音画奖励必须同时吃进文、画、声」这件事,被数字钉住了。
正文没有单独的局限节。数字里能读出几处硬缺口。
域外准确率 63.40%,比乱猜好,离稳定裁判还远。easy 阶段标签来自 Gemini(试点 80% 对齐);hard 阶段解释文本仍是 Gemini 写的,只卡了最终赢家与人一致。人为什么选、模型为什么选,可能不是同一套理由。
时间采样很稀:每段视频最多 12 帧、128 个 token。要判唇形和事件时序,这个分辨率偏低。DeSync 变差,和「人偏好里的语义与画质压过了帧级同步」一致,后训练把同步让出去了。论文把 OmniNFT 的 DeSync 增益叫奖励 hacking,但没验证 VA-Judger 自己有没有换一种 hacking。
训练用的生成器只有 OVI、LTX-2、DaVinci-MagiHuman 三家开源;后训练也只给 LTX-2 加了 LoRA。换底座会不会掉,没做。人类评测 20 人、强制三选一,没有报告标注者一致性。数据描述还自相矛盾:引言写七类、三家模型,贡献里写成 8 家,方法正文是六类。8 大概把评测用的闭源模型算进去了。