在隐空间用几何奖励对齐视频扩散:VGGRPO 绕开逐帧 VAE 解码也能稳住几何

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

ECCV 2026

cs.CV

2026-03-28

一个把视频扩散隐变量直接接上几何基础模型的方案(VGGRPO),在隐空间用相机平滑度和重投影一致性两个奖励做 GRPO 后训练,绕开反复 VAE 解码;在 Wan2.1/2.2 上几何一致性和运动平滑度全面超过 Epipolar-DPO、VideoGPA,还省 24.5% 时间。

这篇在解决什么

大规模视频扩散模型(diffusion model)画面好看,但几何不靠谱:相机轨迹抖、场景结构漂、物体在 3D 里对不齐。已有改进两条路都有硬伤。一条是给生成器加几何模块,但改结构会削弱从互联网规模预训练里继承来的泛化能力。另一条是几何感知的对齐(alignment),在生成后做校正,但现有方法只对静态场景有效,而且奖励要在 RGB 像素空间算,每算一次都得把隐变量(latent)用 VAE 解码回像素,计算开销巨大,还对解码噪声敏感。这篇要的是:既不动生成器结构、又不反复解码,还能处理动态场景。

方法

关键是一个「隐空间几何模型」(Latent Geometry Model,LGM)。它的做法是把视频扩散模型吐出的隐变量,通过一个学出来的 3D 卷积连接层,直接接到一个预训练的几何基础模型上,具体是替换掉几何模型前面若干层,让隐变量直接映射进它的中间特征空间,连接层参数靠校准数据上的特征对齐误差来学。这样几何信息可以直接从隐变量读出来,完全不用回到像素空间。一个聪明的选择是把 LGM 建在一个支持 4D 重建的几何模型(Any4D)上,于是它天然就能处理动态场景,绕开了前人只能做静态场景的限制。

在这个基础上,做隐空间版的 GRPO(Group Relative Policy Optimization),用两个互补的奖励:一个是相机运动平滑度奖励,从预测的相机位姿里算尺度归一化的加速度,惩罚抖动轨迹;另一个是几何重投影一致性奖励,把预测的点云重投影到不同视角、比对深度,强制跨视角几何连贯。两个奖励都在隐空间算,所以整组策略更新都不需要反复 VAE 解码。

结果

在静态(DL3DV、RealEstate10K,190 条描述)和动态(MiraData,200 条描述)两类基准上,用 LoRA 微调 Wan2.1-1B 和 Wan2.2-5B(group size 64),和 Base、SFT、Epipolar-DPO、VideoGPA 比。Wan2.1-1B 静态场景:

指标VGGRPOEpipolar-DPOVideoGPA
主体一致性59.4754.2153.68
背景一致性66.8455.7956.32
运动平滑度57.0045.5042.50

Wan2.2-5B 动态场景,主体一致性 62.63(Epipolar-DPO 52.11、VideoGPA 54.74),运动质量 68.42 对 58.95/60.53,运动平滑度 56.50 对 38.00/40.00。效率上,隐空间奖励把每步时间从 54.73 秒降到 41.33 秒(降 24.5%),峰值显存从 76.80 GB 降到 68.57 GB。几何基础模型的选择也重要:动态场景上 Any4D(视觉质量 59.57、运动质量 67.21)优于 VGGT(54.96、60.61)。

为什么重要

对做视频生成的人来说,这条路线的价值是「不破坏预训练能力的同时改善几何」。前面那些改结构的方案最大的代价就是牺牲泛化,VGGRPO 通过只做后训练、奖励全在隐空间算,既保住了互联网预训练的底子,又把对齐的计算成本压了下来,还能扩展到前人做不了的动态场景。它也给了一个可复用的组件(LGM),换更强的 4D 几何模型就能继续涨。

局限与存疑

论文没有专门的局限小节,几个问题得自己看。最明显的是动态度(Dynamic Degree)略降(0.3962 对基线 0.4237):运动平滑度奖励压住了相机抖动,而 RAFT 光流把「不那么抖」误读成「动态不足」,也就是说平滑度和「看起来动得够不够」在这里是打架的指标。其次是成本:训练 LGM 本身要约 1536 GPU 小时,前期投入不低。方法效果也高度依赖底层几何基础模型的质量,Any4D 强它才强,这是个上限锁。最后,几何一致性的提升和用户主观画质之间是不是一回事,论文没有做主观评测来验证。

术语

原文与代码

社区讨论

相关论文

全部论文解读