RVM把扩散奖励微调写成速度场加权回归,训练便宜一个数量级

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

cs.CV, cs.LG

2026-08-25

RVM把奖励直接乘到速度场回归上微调扩散模型,不必估似然也不必存轨迹。Wan2.1-1.3B上VBench Overall 84.13,8张H100训练约525小时,约为DanceGRPO协议的十二分之一。

这篇在解决什么

扩散模型做奖励微调时,默认动作是把 LLM 的 PPO、GRPO 搬过来。语言模型有逐步可乘的 token 似然,扩散没有:终点样本的边际似然算不出来。现有两路补丁都贵。轨迹法用每步高斯转移的似然代替,必须走 SDE、必须把整条去噪轨迹存下来,终点奖励还要穿过一串随机中间态,方差大。ELBO 法则只对终点做似然下界,免了存轨迹,但仍要估策略比。

Georgia Tech 与 NVIDIA 把 ELBO 政策梯度展开后发现,参数更新已经是奖励加权的速度回归。他们直接砍掉似然这一层,提出 reward-based velocity matching(RVM):在扩散模型本来就在学的速度场上,用有符号的奖励权重做回归。

方法

流匹配的训练目标本来就是速度。干净样本 x0 与噪声 ε 插值到 xt,标签速度 v = ε − x0。RVM 的循环很短:

没有策略比、没有 clipping、没有轨迹存储。视频默认用 16 步确定性 ODE,关掉 CFG,锚强度 β=0,更新进一步退化成纯奖励加权回归。LoRA 微调 Wan2.1-T2V-1.3B 时 rank 128、90 个 epoch、8 张 H100。

RAM 和 DiffusionNFT 在梯度上是 RVM 的特例:前者 on-policy、锚在参考速度、β=1;后者用 EMA 锚,把 [0,1] 奖励映成有符号权重。损失函数长什么样几乎分不出胜负,真正拉动数字的是奖励怎么写、锚怎么选。

视频实验把这一点写得很死。VideoAlign 和 HPSv3 会把模型推向「画面干净、几乎静止」。他们加了 dynamic-tracking(DT)奖励:RAFT 光流看相邻帧里最快的 5% 像素,低于分辨率相关阈值就扣分。I2V 还用了第二版,减去中位光流、只给中等幅度的前景运动打分,防止靠整帧背景漂移刷分。默认混合是文本对齐 1.5、运动质量 1.0、HPSv3 0.2、DT 0.7。

结果

Wan2.1-T2V-1.3B,VBench,每条 prompt 一条视频:

方法Dynamic DegreeOverallGPU-h(8×H100)
基座无 CFG54.1776.02未报
基座 CFG=565.2883.10未报
FlowGRPO55.5675.911,159
DanceGRPO†58.3379.466,171
TaRoS-72B†58.3380.566,171
DiffusionNFT63.8982.95未报
RAM61.1181.95未报
RVM75.0084.13525

†DanceGRPO / TaRoS 是引用数字,协议不同(CFG、50 步 SDE、每 prompt 五条视频),不能当严格对照。RVM 相对 FlowGRPO 便宜 2.2 倍,相对 DanceGRPO / TaRoS 那组协议便宜 11.8 倍。便宜来自 16 步无 CFG 的 ODE,以及更新时只对一个加噪状态回归。

去掉 DT,动态程度只剩 5.56,Overall 80.39。加上 DT 才到 75.00 / 84.13。运动是奖励问题,不是损失形式问题。

SkyReels-I2V 上 FlowGRPO 把 Overall 从 81.68 打到 77.97;RVM 到 86.27,动态程度 72.36(基座 64.63)。NFT 86.16、RAM 86.61,三个速度法的总分挤在一起。SD3.5-M 的 OCR 任务里 RVM 拿到 OCR 0.95、PickScore 23.03,和 ELBO 路线的 PEPG(0.94 / 22.93)持平并略高。

少步更稳。基座带 CFG 从 16 步 83.10 掉到 5 步 73.62、4 步 64.39;RVM 无 CFG 只掉 0.43 和 1.83,4 步仍接近基座 16 步加 CFG。锚项消融里 β=0 总分最高;把锚钉在 CFG=5 的参考速度上,Semantic 从 76.29 提到 78.48。RVM 的 Semantic 76.28 仍低于带 CFG 的基座 80.64,总分赢在画质和运动。

为什么重要

视频扩散的 post-training 可以先把轨迹似然那套放一边。速度场就是训练接口,奖励加权回归能直接接确定性 ODE,实现成本低。RVM、RAM、DiffusionNFT 数字接近,再发明一种损失的边际收益已经很小。该投时间的是奖励:视频必须显式奖励「动起来」,否则偏好模型会把生成训成静帧。

问题被重新定位了:扩散奖励微调更适合写在原生速度表示上。RVM 没有新采样器、没有新骨干,增量在配方和奖励,属于把已有速度回归写清楚的工作。

局限与存疑

正文没有独立的 Limitations 节。DanceGRPO / TaRoS 的 11.8 倍成本对比混进了训练步数和采样设置,不能读成「同一协议下快一个数量级」。主表每 prompt 一条视频,没报方差。视频默认 β=0,和「带锚的统一框架」叙事有点拧。固定点分析也写明,学到的速度场不必等于自身终点分布诱导的条件速度。DT 依赖 RAFT 和手调阈值,I2V 版阈值来自更早微调跑的人工标注,换数据就要重标定。未来方向只提了一句自回归视频,没有实验。

术语

原文与代码

社区讨论

相关论文

全部论文解读