自适应奖励路由:用前向过程 RL 联合优化音视频扩散模型多目标

_akhaliq · x · 2026-10-03

论文提出 Adaptive Reward Routing,用于在联合音频-视频扩散模型的前向过程强化学习(DiffusionNFT)中动态适配更新位置与奖励组合。方法包含两部分:

实验显示在模态质量、语义一致性和音视频同步性上均优于强 RL 基线,消融与机制分析验证了两组件的互补收益。

所属事件:腾讯提出自适应奖励路由优化音视频联合扩散(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →