Google 用潜空间 4D 奖励改进视频生成

jiqizhixin · x · 2026-07-28

Google 研究人员联合哥本哈根大学和牛津大学提出了 VGGRPO,目标是让视频生成不再“画面好看但物理崩坏”。

方法是先训练一个潜空间几何模型,直接从视频扩散模型的内部表示中读取场景深度与运动,再用强化学习加入两类奖励:镜头运动平滑 和 3D 几何一致性。据帖文描述,这套方法在镜头稳定性、几何一致性和整体画质上都优于以往方案,同时还避免了昂贵的 VAE decoding。

核心思路

结果

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →