自适应奖励路由:用前向过程 RL 联合优化音视频扩散模型多目标
_akhaliq · x · 2026-10-03
论文提出 Adaptive Reward Routing,用于在联合音频-视频扩散模型的前向过程强化学习(DiffusionNFT)中动态适配更新位置与奖励组合。方法包含两部分:
- 跨模态影响引导路由:利用双向跨注意力响应作为跨模态影响的代理指标,动态重加权 token 级损失并缩放跨模态层梯度,无需额外模型干预即可定位奖励更新应作用的位置。
- 保偏好模态感知重加权:将预设权重作为偏好先验保留,用分支特定的奖励梯度交互在预热后做残差修正,避免强势奖励压制弱但关键的目标。
实验显示在模态质量、语义一致性和音视频同步性上均优于强 RL 基线,消融与机制分析验证了两组件的互补收益。
所属事件:腾讯提出自适应奖励路由优化音视频联合扩散(2 条相关)→
「多模态」频道最新
- AI 导演 Junie Lau 登上 Forbes,新片《Goldfish Mayhem》下周首映 — JunieLauX · 2026-10-03
- fal H3 Max 视频生成新增首/中/尾帧关键帧控制 — OdinLovis · 2026-10-03
- 在 ChatGPT Dots 里跑 Blender,AI 自己建模绑骨还配了乐 — OpenAIDevs · 2026-10-03
- Tavus 发布 Griffin:开口先于生成完成,音画延迟仅 0.43 秒 — TejasKumar_ · 2026-10-03
- 手把手修复 Mac 上 MiniMax H3 视频生成的 VAE 崩溃 — Kris_RenderBob · 2026-10-03
- 字节发布 DMAD:对抗蒸馏让 MiniMax H3 视频四步生成 — AgeNo5351 · 2026-10-03