VGGRPO 在隐空间用几何奖励对齐视频扩散模型
量子位 · wechat · 2026-07-29
VGGRPO 用隐空间几何奖励提升视频生成的一致性
来自 Google、哥本哈根大学、牛津大学等机构的研究者提出 VGGRPO(Visual Geometry GRPO),目标是在不破坏互联网规模预训练模型泛化能力的前提下,减少视频扩散模型中的几何漂移、镜头抖动和场景结构不连贯问题。
方法核心
- 先构建 Latent Geometry Model(LGM),把视频模型的 VAE 隐变量与预训练几何基础模型连接起来,使几何信息可直接在 latent space 中预测。
- 不再依赖昂贵的 RGB 空间奖励和反复 VAE 解码,而是在隐空间里做 GRPO 对齐。
- 设计了两类奖励:
- 摄像机运动平滑奖励:惩罚抖动轨迹,鼓励平滑镜头运动。
- 几何重投影一致性奖励:约束不同视角下的场景几何一致,尤其针对动态场景做了静态区域过滤。
结果与意义
论文称,该方法在静态和动态场景基准上都优于基线,同时没有牺牲通用视频质量指标。作者认为,这种几何感知的后训练范式对 world models、具身智能 等需要稳定世界建模的方向很有价值。
所属事件:Google联合高校推出VGGRPO提升视频生成物理一致性(2 条相关)→
「多模态」频道最新
- Sora 级写实视频:韩国街头夏日午后全流程 — SimplyAnnisa · 2026-08-25
- 实测:LTX 2.5 音频响应反而退步? — ART-ficial-Ignorance · 2026-08-25
- Krea 2 Turbo 4步 LoRA 更新:误差降46%细节提升 — TimeTruth2490 · 2026-08-25
- Midjourney V8.2 新风格:sref 930114505 — azed_ai · 2026-08-25
- ComfyUI SAM 3 视频抠像工作流:快速且精准的 VFX 方案 — ShroakzGaming · 2026-08-25
- 终于可用的 AI 生成深度通道:ComfyUI 实践指南 — ShroakzGaming · 2026-08-25