把几何基础模型压成 64 通道潜空间,相机轨迹误差减半

GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

Jiahao Lu, Minghao Yin, Wenbo Hu, Hengyu Liu, Wang Zhao, Sai-Kit Yeung, Ying Shan, Yuan Liu

cs.CV

2026-09-22

GAE 把冻结 DA3 的四层特征压成 64/128 通道潜变量,同一套 flow 同时解码 RGB 与深度。对照实验中 RealEstate10K 的 FVD 下降 12.7%,相机轨迹误差减半。

这篇在解决什么

视频生成器能做出很像真的单帧,但换视角后物体会漂、相机路径会对不上。几何基础模型反过来能从几张真图里读出一致的深度、相机和点图。常见补救是在外观潜变量旁边再加相机控制、几何对齐或事后奖励。GAE 的判断是:问题出在生成器演化的那个状态本身就不带几何。

直接拿几何骨干的多层特征去扩散也不合适。DA3-GIANT 单层就有 3072 通道,有效秩大约只有 11,条件数从 10^8 到 10^16。浅层保住跨视角对应,深层更平滑但空间结构更弱。GLD 一类工作用级联 flow 分别建模若干层,状态又多又耦合。

方法

GAE 分两阶段。第一阶段在冻结的 DA3 编码器与冻结的 DPT 几何头之间学一个瓶颈:四层特征按通道拼起来,压成与补丁网格同尺寸、通道数为 64 或 128 的潜变量,再一次性重建整棵特征树。几何头保持冻结,压缩丢掉的信息没法靠头去补。同一潜变量另接可学习 RGB 头,强迫外观和几何住在同一份状态里。

重建只约束「保住什么」,不约束「怎么排」。token 级对齐 C-RADIO 能改善传输平滑度和语义邻域,但会打乱成对空间关系。再让后验里的成对相似度去贴 DINOv2,关系结构才回来。教师在 codec 训完后丢掉。

第二阶段冻结 codec,在标准化后验均值上训 DiT 式条件 flow。文本、度量 Plücker 射线、干净参考视图的潜变量都当控制信号,只有目标视角的潜变量在 ODE 里走。条件 dropout 让同一套权重覆盖文生图、相机控制视频和参考图新视角。

结果

受控对照固定生成器、训练预算和采样:64 个场景、每场景 9 视角、252²、1 张参考、50 步 Euler、CFG=2。

潜变量RE10K FVDDL3DV FVDRE10K ATE
SD-VAE258.6373.20.0072
RAEv2379.4453.40.0085
DA3 L0298.6376.50.0085
GAE-64225.7287.00.0034
GAE-128233.4345.20.0041

相对最强非 GAE 对照,FVD 降 12.7% 和 23.1%;RE10K 上 VGGT 轨迹误差降 52.8%。几何从采样潜变量直接解码,相对 Pi3 参考,GAE-64 在 DL3DV 上六项全领先。81 视角长 rollout 和文生图是另一套更大模型的定性展示,点云只是 81 张深度图按解码相机反投影拼接,没有测试时优化,不进入对照表。

为什么重要

世界模型如果要「写出」感知能读懂的场景,潜空间就得原生可解码几何。GAE 说明不必级联多层特征,也不必在外观 latent 旁再挂一条几何支路:把感知骨干的层级重参数化成一份紧凑欧氏状态,标准 flow 就够用。做新视角、相机可控视频的人,可以先换 tokenizer,再谈更大的生成器。

局限与存疑

对照分辨率低、视角少,长序列和文生图没有同等数字。几何读写绑在冻结的 DA3 上,换骨干或动态场景会不会掉,论文没测。token 对齐单独用会毁掉关系结构,两个教师缺一不可,超参敏感。GLD、Gen3R 是完整管线,不能和「只换 latent」公平比速度或规模。点云由逐帧深度反投影拼接,没有跨视角融合。

术语

原文与代码

社区讨论

相关论文

全部论文解读