上海AI Lab 提出音视频联合生成强化学习方法 AV-GRPO,质量超 LTX-2.3
Shanghai-AI-Laboratory · hf · 2026-09-25
上海人工智能实验室发布 AV-GRPO,一个面向音视频联合生成的模态锚定在线扩散强化学习框架,并配套解耦、难度可控的训练数据集 5DAV。
针对现有联合音视频生成的三大痛点——单模态保真度不足、文本对齐弱、跨模态同步差——直接套用 RL 后训练面临异构多模态奖励纠缠、双塔联合优化成本高、同步评估依赖配对样本等问题。AV-GRPO 包含三个关键模块:
- 模态锚定 rollout:解缠学习信号,稳定难度;
- 轨迹锁定冻结塔优化:降低成本并重新分配 credit;
- 按模态动态自适应的目标函数与扰动强度,把耦合的多模态偏好学习拆成单模态子问题。
在 JavisBench 和 VABench 上,AV-GRPO 在生成质量、语义对齐和跨模态同步上均超过 LTX-2.3(LoRA 与全量微调均验证),消融实验确认各设计有效。代码与数据已开源。
「多模态」频道最新
- Claude Opus 5.5 仅凭图纸和照片建出电熔炉交互式 3D 模型 — EricBuess · 2026-09-25
- invideo 上线 Effects:用自然语言在时间线上生成 AE 级特效 — Uncanny_Harry · 2026-09-25
- 博主用 Suno 批量做 Claude 末日 MV,索性让 Claude 自己写回应歌 — marcosalvi · 2026-09-25
- 一周生成超千首歌后,博主断言 ElevenMusic 2.5 无可匹敌 — kirbyman01 · 2026-09-25
- 开源 ComfyUI 时间线编辑器 Sonder 更新:角色参考一键管理,适配 MiniMax H3 — SonderSaid · 2026-09-25
- 用 Opus 5.5 加本地模型复刻《OVERLORD》片头,效果惊艳 — heliumcraft · 2026-09-25