新方法 RVM 跳过轨迹存储,低成本提升扩散模型 RL 微调

LucaAmb · x · 2026-08-28

论文提出了一种名为“奖励速度匹配”(RVM)的新方法,用于扩散模型的强化学习微调。传统方法需要存储轨迹或进行复杂的似然估计,计算成本高昂。RVM 直接在速度场上进行更新,通过奖励加权强化高生成质量的方向,抑制低奖励方向,并支持可选的锚点项以控制漂移。实验表明,RVM 在计算成本大幅降低的情况下,性能匹配或超越基于轨迹的策略梯度方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →