音画生成拼指标会刷分,复旦VA-Judger后训练人选定62%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

cs.CV

2026-08-19

复旦用约一万对人类音画偏好训出VA-Judger奖励模型,对齐准确率68.4%;拿它后训练LTX-2,两百条三选一人选定62%,拼指标的OmniNFT只有27.6%。

这篇在解决什么

联合音画生成已经能在一次前向里同时出画面和同步声音。下一步是用强化学习做后训练,把结果往人觉得好的方向推。卡点是奖励。

现成做法以 OmniNFT 为代表:VideoAlign 和 HPSv3 管画面,Audiobox Aesthetics 管声音,CLAP 管声文对齐,DeSync / SynchFormer 管时间同步,几个分数加权拼成奖励。人看一段带声视频,依据是文、画、声、动作、语义是不是同一件事。同步分高但事件错了、画面漂亮但情绪对不上、各项指标都过关但整体别扭,都会发生。把这些单指标拿来两两选赢家,总体准确率只有 50.43% 到 56.88%,没有一项超过 56.88%。拿这种奖励优化,模型会刷指标、对人发虚。图像侧的 ImageReward、视频侧的 VideoReward 都听不到声音;纯音频指标又看不到画面。把两边分数加起来,跨模态交互补不回来。

方法

复旦、上海创智学院和阴旺智能做了三件事:偏好数据、跨模态裁判、拿裁判去后训练生成器。

数据叫 VAPref-10K。从 YouTube、B 站、电影和剧集收了 10173 条真实音画,剪成 5–10 秒,分成六类:多人对话、旁白、音乐、电影氛围、环境事件、讲话。Qwen3.5-Omni 先出带时间戳的稠密描述,再用 Qwen 改写成可生成的 prompt,留下 10083 条。候选片段由开源模型 OVI、LTX-2、DaVinci-MagiHuman 生成。标注不做绝对打分:同一 prompt 的两段比一对,选出更好的,并勾出支撑判断的质量维度。

配对按难度拆。easy 池 4.4K 对,主要是 OVI 对 LTX-2(对话和旁白再加 DaVinci-MagiHuman),质量差大、胜负清楚。hard 池原始 9.8K 对,多数是同一模型、同一 prompt、不同随机种子,只能抠细微音画差。汇总约 9K 条 prompt、10.3K 组成对比较。

裁判 VA-Judger 从 Qwen3-Omni-30B-A3B-Instruct 起步,视觉和音频编码器冻结,只训语言骨干。输入是固定评分量表、一条文本 prompt、两段带声视频。模型给每段在五个维度上打 1–10 分并写短理由,再汇总总分,最后用 <answer>video k is better</answer> 收口。五维分别是:(A) prompt 对齐,(B) 音画一致,(C) 音频质量,(D) 视频质量,(E) 完整与连贯。

训练分三阶段。

评测基准 VA-Judger-Bench 共 1150 对:easy 400、域内 hard 250、域外 500。域外来自 AVGenBench,拿 Kling 2.6、Wan 2.6、Veo 3.1 Fast / Quality、Sora 2 互相比,训练时没见过。

后训练拿 19B 的 LTX-2 当策略,沿用 OmniNFT 的强化学习框架,把五个独立专家奖励换成 VA-Judger。每个 prompt 生成 8 个候选、组成 28 对。C 维当音频奖励,D 维当视频奖励,A / B / E 平均当跨模态共享奖励。骨干冻结,只训 LoRA。

结果

先看裁判准不准。

方法Easy域内域外总体
Javis Score(最好的单指标)60.0055.5154.9656.88
Qwen3-Omni Instruct CoT63.2554.8055.0057.83
Easy SFT72.0059.2056.2062.35
Hard SFT74.5063.6060.2065.91
GRPO(VA-Judger)76.2566.0063.4068.43

单指标整体停在 50.43%–56.88%。VideoAlign 和 AudioBox 在 easy 上还能到 62.39% 和 58.70%,域外掉到 48.35% 和 44.00%:单模态在大质量差上偶尔能猜,难例和闭源模型上不行。三阶段逐步加分,最终比 Qwen3-Omni CoT 高 10.60 个百分点。

再看拿它后训练 LTX-2。评测是 JavisBench 随机 200 条 prompt。

方法视觉质量 VQ运动 MQ音频 AQJavisScoreAVHScore文声对齐
LTX-22.2480.6974.7670.0740.0910.105
OmniNFT3.7270.9475.3990.1220.1460.133
VA-Judger3.9421.1835.6100.2300.2610.180

13 项 JavisBench 指标里拿了 11 项第一,7 项补充指标里拿了 6 项。DeSync(越低越好)走了反方向:基座 0.430,OmniNFT 0.226,VA-Judger 后训练 0.592。OmniNFT 专门优化同步指标,人并不买账。

20 名受试者对这 200 条做三选一:VA-Judger 后训练拿 62.30% 人票,OmniNFT 27.63%,基座 LTX-2 10.08%。大约是 OmniNFT 的两倍、基座的六倍。

为什么重要

音画联合生成的强化学习后训练,缺的是能看完整文-画-声体验的奖励,不是再叠一个同步分数。VA-Judger 把路径从「拼开源指标」改成「人类成对偏好加可解释量表」,并且换奖励之后人真能看出来。

已经在跑 OmniNFT 一类流程的团队,最直接的用法是把奖励头换成这个裁判,代码已开源。不要把它当万能评测器:域外 63.40% 说明闭源模型之间的细微差别,它还经常判错。

这是渐进工作。新意在数据、由易到难的微调和把 GRPO 奖励拆到人指定的维度,组合大于单点新模块。但「音画奖励必须同时吃进文、画、声」这件事,被数字钉住了。

局限与存疑

正文没有单独的局限节。数字里能读出几处硬缺口。

域外准确率 63.40%,比乱猜好,离稳定裁判还远。easy 阶段标签来自 Gemini(试点 80% 对齐);hard 阶段解释文本仍是 Gemini 写的,只卡了最终赢家与人一致。人为什么选、模型为什么选,可能不是同一套理由。

时间采样很稀:每段视频最多 12 帧、128 个 token。要判唇形和事件时序,这个分辨率偏低。DeSync 变差,和「人偏好里的语义与画质压过了帧级同步」一致,后训练把同步让出去了。论文把 OmniNFT 的 DeSync 增益叫奖励 hacking,但没验证 VA-Judger 自己有没有换一种 hacking。

训练用的生成器只有 OVI、LTX-2、DaVinci-MagiHuman 三家开源;后训练也只给 LTX-2 加了 LoRA。换底座会不会掉,没做。人类评测 20 人、强制三选一,没有报告标注者一致性。数据描述还自相矛盾:引言写七类、三家模型,贡献里写成 8 家,方法正文是六类。8 大概把评测用的闭源模型算进去了。

术语

原文与代码

相关论文

全部论文解读