腾讯自适应奖励路由:前向过程 RL 动态优化音视频联合扩散的多奖励冲突

tencent · hf · 2026-10-02

腾讯论文针对多奖励引导 RL 训练音视频联合扩散模型的两个痛点——奖励驱动的更新应作用在哪里、竞争奖励应如何组合——提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中动态适配更新位置与奖励协调。

两个组件:

实验显示在模态质量、语义一致性与音视频同步上持续优于强 RL 基线,消融与机制分析验证两个组件互补。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →