复旦团队提出 VA-Judger,用人类偏好给音视频生成当裁判
量子位 · wechat · 2026-09-21
复旦大学与上海创智学院团队提出联合音视频生成的奖励模型 VA-Judger,解决现有专项指标(VideoAlign、AudioBox、CLAP、SynchFormer 等)只看局部、忽略整体体验,以及用作 RL 奖励时被「刷分」的问题。
核心做法
- 从 YouTube、B 站、影视剧收集一万多段真实视听片段,构建 VAPref-10K:约 9000 条提示、一万多组成对偏好,标注者既选谁更好,也指出关键质量维度。
- 数据分 EasyPair(跨模型,差距明显)和 HardPair(同模型同提示不同种子,逼模型看细节)。
- 三阶段训练:EasySFT 学结构化评审规则 → HardSFT 对齐困难偏好 → Dimension-wise GRPO 同时奖励正确选择与关键维度打分。
效果
- VA-Judger-Bench 上偏好预测准确率从单项指标最高 56.88% 提升到 68.43%。
- 接入 LTX-2 后训练(每提示 8 候选、28 次两两循环赛,主干冻结只训 LoRA):JavisBench 13 项指标中 11 项第一;人类三选一偏好率 62.30%,远超基线的 10.08% 和 27.63%。
论文、代码与 Demo 均已公开。
「多模态」频道最新
- 网友为 Qwen-Image-2.1 整理 9 个 ComfyUI 基础工作流 — nomadoor · 2026-09-21
- 任意视频一键体积化播放,可导出 360° 环绕镜头 — LinusEkenstam · 2026-09-21
- 一张图加一条提示词生成整段电影感视频,作者晒完整 prompt — umesh_ai · 2026-09-21
- Krea2 全流程实战:四个 LoRA 打造 AI 原生概念艺术管线 — Dacrikka · 2026-09-21
- 手机视频一键转可浏览 3D 房间,K3 训练 splat 模型全流程 — willeastcott · 2026-09-21
- 阿拉伯语圈玩法:上传照片加名字,AI 秒变杂志封面 — aziz4ai · 2026-09-21