VGGRPO 在隐空间用几何奖励对齐视频扩散模型

量子位 · wechat · 2026-07-29

VGGRPO 用隐空间几何奖励提升视频生成的一致性

来自 Google、哥本哈根大学、牛津大学等机构的研究者提出 VGGRPO(Visual Geometry GRPO),目标是在不破坏互联网规模预训练模型泛化能力的前提下,减少视频扩散模型中的几何漂移、镜头抖动和场景结构不连贯问题。

方法核心

结果与意义

论文称,该方法在静态和动态场景基准上都优于基线,同时没有牺牲通用视频质量指标。作者认为,这种几何感知的后训练范式对 world models、具身智能 等需要稳定世界建模的方向很有价值。

所属事件:Google联合高校推出VGGRPO提升视频生成物理一致性(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →