VA-Judger:首个视频音频联合生成的人类偏好奖励模型

bdsqlsz · x · 2026-08-21

研究团队发布 VA-Judger,首个面向联合视频-音频生成的全模态奖励模型。核心问题:现有方法将音质、画质、同步等维度分别打分,无法捕捉 prompt、视频、音频之间整体的语义与时序一致性,导致 RL 后训练中出现 reward hacking——指标分高但人眼看着不连贯。

工作要点:

实验中用 VA-Judger 后训练的 LTX-2 生成内容与人类偏好对齐度显著提升。转发者 bdsqlsz 猜测该奖励模型也可用于训练 MiniMax H3。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →