VA-Judger:首个视频音频联合生成的人类偏好奖励模型
bdsqlsz · x · 2026-08-21
研究团队发布 VA-Judger,首个面向联合视频-音频生成的全模态奖励模型。核心问题:现有方法将音质、画质、同步等维度分别打分,无法捕捉 prompt、视频、音频之间整体的语义与时序一致性,导致 RL 后训练中出现 reward hacking——指标分高但人眼看着不连贯。
工作要点:
- 构建 VAPref-10K 人类偏好数据集:9K 条 prompt、10.3K 组细粒度成对比较,样本来自开源生成模型
- 提出 VA-Judger-Bench 基准,含域内外模型对比,检验奖励模型是否真正对齐人类偏好
- VA-Judger 采用思维链(CoT)奖励建模,先从质量差距明显的样本对学习结构化输出与粗粒度偏好判别,再逐步精化
实验中用 VA-Judger 后训练的 LTX-2 生成内容与人类偏好对齐度显著提升。转发者 bdsqlsz 猜测该奖励模型也可用于训练 MiniMax H3。
「多模态」频道最新
- 字节跳动论文:结构化提示词提升图像生成质量 — jiqizhixin · 2026-08-21
- 教程:用 Adobe Firefly 生成元素与角色 — LudovicCreator · 2026-08-21
- 解决 LTX 2.5 严重拖影:移植自定义节点与工作流 — SillyLilithh · 2026-08-21
- 资深艺术总监实测:Grok Imagine 省时神器,截图一键转游戏资产 — hexiang · 2026-08-21
- Fairground AI 创作者电视频道登陆亚马逊 Prime Video — dolma33 · 2026-08-21
- 本地运行 MiniMax H3,可实现视频无缝延长生成 — cocktailpeanut · 2026-08-21