Google 用潜空间 4D 奖励改进视频生成
jiqizhixin · x · 2026-07-28
Google 研究人员联合哥本哈根大学和牛津大学提出了 VGGRPO,目标是让视频生成不再“画面好看但物理崩坏”。
方法是先训练一个潜空间几何模型,直接从视频扩散模型的内部表示中读取场景深度与运动,再用强化学习加入两类奖励:镜头运动平滑 和 3D 几何一致性。据帖文描述,这套方法在镜头稳定性、几何一致性和整体画质上都优于以往方案,同时还避免了昂贵的 VAE decoding。
核心思路
- 在视频扩散潜变量上接一个几何模型
- 用两种奖励训练:运动平滑、几何一致
- 全流程都在 latent space 里完成
结果
- 更稳定的 camera path
- 更一致的 3D 几何
- 更好的整体生成质量
所属事件:Google联合高校推出VGGRPO提升视频生成物理一致性(2 条相关)→
「多模态」频道最新
- 用户给 Opus 5.5 三小时预算,模型自主拍出九龙超现实恐怖短片 — rainbird · 2026-09-23
- AI 生图博主分享高速公路场景 prompt,自晒连续出图效果 — techhalla · 2026-09-23
- Opus 5.5 生成 2000 年代风格火柴人格斗动画 — JasonBotterill · 2026-09-23
- 《平常》:AI 生成九龙城寨题材恐怖短片引发关注 — rainbird · 2026-09-23
- 截图角色配一条提示词即可生成同款角色 — iamaliveix · 2026-09-23
- Google 开源 Noto 3D:2D 贴纸变立体,才发现狗狗只有三条腿 — GoogleDesign · 2026-09-23