Google 用潜空间 4D 奖励改进视频生成
jiqizhixin · x · 2026-07-28
Google 研究人员联合哥本哈根大学和牛津大学提出了 VGGRPO,目标是让视频生成不再“画面好看但物理崩坏”。
方法是先训练一个潜空间几何模型,直接从视频扩散模型的内部表示中读取场景深度与运动,再用强化学习加入两类奖励:镜头运动平滑 和 3D 几何一致性。据帖文描述,这套方法在镜头稳定性、几何一致性和整体画质上都优于以往方案,同时还避免了昂贵的 VAE decoding。
核心思路
- 在视频扩散潜变量上接一个几何模型
- 用两种奖励训练:运动平滑、几何一致
- 全流程都在 latent space 里完成
结果
- 更稳定的 camera path
- 更一致的 3D 几何
- 更好的整体生成质量
「多模态」频道最新
- Google DeepMind 重建 Pelé 1959 失传进球并开放 GNM — plopesresearch · 2026-07-28
- Krea 2 被测出能生成 50 款汽车全列表 — poopoo_fingers · 2026-07-28
- Opus 5 演示产品视频生成,零剪辑也能做镜头运动 — iamrobotbear · 2026-07-28
- Diffusers 原生接入 Nunchaku 4 比特扩散推理 — dl_weekly · 2026-07-28
- Kimi-K3 支持 8-bit 图文到文本,可在主流 GPU 栈运行 — petrusenko_max · 2026-07-28
- AI 生成动画展示:融合巴西文化的音乐视频《A Massa》 — LeoMendesMusic · 2026-07-28