跳过 RGB 直接出 4D:一个 4D 解码器靠共享 VAE 隐空间通吃多款视频生成器

Beyond Pixels: From Video Priors to 4D Worlds

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

cs.CV

2026-08-11

4D 生成要么先生成 RGB 视频再重建几何(误差会传播),要么把几何绑死在某个生成器上(换模型要重训)。Latent-to-4D 用视频模型最终去噪后的 VAE 隐变量当可复用接口,配一个 L4AR 对齐精修网络接上预训练 4D 解码器,一个检查点不改地跨三款共享同一 VAE 的视频 DiT。在 Text4D-200 和 I4D-200 上投影 DINO-F1 比同隐空间的 Wan+4RC 级联高 2.88 到 3.45 和 5.81 分。

这篇在解决什么

4D 生成要合成带显式几何和运动的动态 3D 场景(可换视角看)。现有两条路都有硬伤。「先生成再重建」先合成多视角或时序 RGB,再用一个单独训练的重建模型转成 4D;它的 RGB 接口把一个在窄得多的重建数据上训练的重建器夹在视频先验和 4D 输出之间,开放域内容和时序瑕疵会传进不稳定的几何里。「集成前馈生成」把几何做成生成过程的原生输出,迁移视频先验更直接,但把 4D 预测绑死在某个生成器或条件范式上,换个预训练视频模型可能要重新做几何监督训练。根本难点是:在 4D 监督远比视频数据稀缺的前提下,建立一个能绕开生成 RGB、又能让一条几何监督路径服务多个兼容视频生成器的可复用接口。

方法

关键观察是:共享同一 VAE 检查点、隐变量归一化、张量布局和压缩约定的视频生成器,即便 DiT 主干和条件范式不同,最终去噪后的隐变量也落在同一个表示空间,而且这个表示在 RGB 解码的上游。作者把视频模型本身当编码器,用它的最终去噪 VAE 隐变量当 4D 解码的输入接口,绕开 RGB。

Latent-to-4D 把这件事拆成对齐、精修、解码三步,核心是 L4AR(Latent-to-4D Alignment and Refinement)网络:

训练时用冻结 VAE 编码约 1,143 条带 4D 标注的重建片段,只更新对齐模块、轻量精修更新(rank-16 LoRA)和几何与相机头;视频 DiT、VAE、原始 Transformer 权重、相机和时间 token 全程冻结。推理时把观测视频隐变量换成兼容 DiT 的最终去噪隐变量,下游路径完全不变。只要 DiT 共享同一 VAE 约定,一个检查点就能通用,不需要条件专属分支。

结果

在锁定的 Text4D-200(文生 4D)和 I4D-200(图生 4D)上,每个方法跑全部 200 例,从两个离轴相机渲染并报投影 DINO 等指标。一个 Latent-to-4D 检查点不改地跨三款共享 Wan VAE 的 DiT(Wan2.1-T2V-14B、Wan2.1-T2V-1.3B、Wan2.2-I2V-A14B)。

任务方法DINO-F1
文生 4DWan2.1-14B + 4RC53.56
文生 4DOurs (Wan2.1-14B)57.01
图生 4DWan2.2-I2V + 4RC55.79
图生 4DOurs61.60

文生 4D 上 DINO-F1 比匹配的同隐空间 Wan+4RC 级联高 2.88 到 3.45 分,图生 4D 上高 5.81 分,且在 I4D-200 全部指标上排第一(也超过 4DNeX)。消融里去掉 3D 卷积或任一种注意力都会明显掉点。50 人参与的多视角人工评测里,几何保真、完整性、时间稳定性、整体质量四项对 Ours 的偏好都过半,几何和完整性最强。

一个关键诊断:把经验近终端残差投影到对齐零空间后注入隐变量,在 ρ=0.6 时 Ours 在 7-Scenes 和 NRGBD 上的点云漂移是 0.0053 和 0.0047,而「解码成 RGB 再用 4RC」是 0.3827 和 0.3160,相机估计同样趋势。这说明绕开 RGB 确实把生成瑕疵向几何的传播截断了。

为什么重要

这篇把 4D 生成里「生成器」和「几何解码器」的耦合松开了:用共享 VAE 隐空间当接口,一条几何监督路径就能服务一族兼容的视频生成器,换生成器或换条件范式不用重训几何。对做 4D 与 3D 生成、世界模型的团队,这是一个可复用的解耦点,而且继承了上游生成器的运动、外观、轨迹、操控等控制能力而不需条件专属训练。它也直接回应了「先生成再重建」误差传播的老问题。

局限与存疑

作者很诚实。证据限于共享 VAE 约定的范围内,跨 VAE 家族的迁移没有验证。投影类指标(离轴 DINO)是外观依赖的几何相干性代理,不等于生成场景的度量几何精度;多视角人工评测和真值消融是补充证据,但同样不是度量精度。Figure 7 到 8 展示的运动、外观、姿态、轨迹、操控、导航控制是接口兼容性的演示,不证明动作成功或物理正确。训练只用了约 1,143 条片段,4D 监督的稀缺性仍是约束。CogVideoX-5B+4RC 在 RGB 参考 CLIP-I 上仍最高,作者明确不声称对所有指标全面领先。

术语

原文与代码

相关论文

全部论文解读