腾讯提出自适应奖励路由优化音视频联合扩散

腾讯发表论文提出 Adaptive Reward Routing 方法,针对多奖励引导强化学习训练音视频联合扩散模型时的两大痛点——奖励驱动的更新应作用在哪里、相互竞争的奖励应如何组合——给出解决方案。该方法在前向过程强化学习(DiffusionNFT)框架中,动态适配更新位置与奖励组合,实现对多目标冲突的自适应优化,提升联合音视频生成的训练效果。

2026-10-02 ~ 2026-10-03 · 2 条相关