腾讯自适应奖励路由:前向过程 RL 动态优化音视频联合扩散的多奖励冲突
tencent · hf · 2026-10-02
腾讯论文针对多奖励引导 RL 训练音视频联合扩散模型的两个痛点——奖励驱动的更新应作用在哪里、竞争奖励应如何组合——提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中动态适配更新位置与奖励协调。
两个组件:
- 跨模态影响力引导路由:用双向交叉注意力响应作为跨模态影响力的动态代理,重加权 token 级损失并缩放跨模态层梯度,无需额外模型干预;
- 保偏好模态感知重加权:保留预设权重作偏好先验,热身后用分支级奖励梯度交互作残差修正,避免强奖励压制弱但必要的目标。
实验显示在模态质量、语义一致性与音视频同步上持续优于强 RL 基线,消融与机制分析验证两个组件互补。
「多模态」频道最新
- AI 修复老照片三段式工作流:先除损、再上色、后提质 — xiaohu · 2026-10-02
- Netflix 发布口型同步裁判 ATR,七语言基准 AUC 提升 50%+ — netflix · 2026-10-02
- PROWBench:170 个可编程场景检验视频世界模型是否真按程序渲染 — AlayaLab · 2026-10-02
- Stability AI 发布 4Director:用刚性 3D 几何精准控制视频世界模型 — stabilityai · 2026-10-02
- PixelDense:用密集预测教师替代语义编码器做 REPA,GenEval 提至 0.8093 — Lehan Yang · 2026-10-02
- Opus 5.5 绘制插图对比 GPT-Image-2 与 Z-Image 风格差异 — teortaxesTex · 2026-10-02