腾讯提出自适应奖励路由优化音视频联合扩散
腾讯发表论文提出 Adaptive Reward Routing 方法,针对多奖励引导强化学习训练音视频联合扩散模型时的两大痛点——奖励驱动的更新应作用在哪里、相互竞争的奖励应如何组合——给出解决方案。该方法在前向过程强化学习(DiffusionNFT)框架中,动态适配更新位置与奖励组合,实现对多目标冲突的自适应优化,提升联合音视频生成的训练效果。
2026-10-02 ~ 2026-10-03 · 2 条相关
- 腾讯自适应奖励路由:前向过程 RL 动态优化音视频联合扩散的多奖励冲突 — tencent · 2026-10-02
- 自适应奖励路由:用前向过程 RL 联合优化音视频扩散模型多目标 — _akhaliq · 2026-10-03