复旦团队提出 VA-Judger,用人类偏好给音视频生成当裁判

量子位 · wechat · 2026-09-21

复旦大学与上海创智学院团队提出联合音视频生成的奖励模型 VA-Judger,解决现有专项指标(VideoAlign、AudioBox、CLAP、SynchFormer 等)只看局部、忽略整体体验,以及用作 RL 奖励时被「刷分」的问题。

核心做法

效果

论文、代码与 Demo 均已公开。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →