上海AI Lab 提出音视频联合生成强化学习方法 AV-GRPO,质量超 LTX-2.3

Shanghai-AI-Laboratory · hf · 2026-09-25

上海人工智能实验室发布 AV-GRPO,一个面向音视频联合生成的模态锚定在线扩散强化学习框架,并配套解耦、难度可控的训练数据集 5DAV。

针对现有联合音视频生成的三大痛点——单模态保真度不足、文本对齐弱、跨模态同步差——直接套用 RL 后训练面临异构多模态奖励纠缠、双塔联合优化成本高、同步评估依赖配对样本等问题。AV-GRPO 包含三个关键模块:

在 JavisBench 和 VABench 上,AV-GRPO 在生成质量、语义对齐和跨模态同步上均超过 LTX-2.3(LoRA 与全量微调均验证),消融实验确认各设计有效。代码与数据已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →