V-RAE: Rethinking Video Latent Spaces for Generation
Minghui Guo, Shengqiong Wu, Hao Fei
cs.CV
2026-08-14
V-RAE 用冻结视觉基础模型特征加 3M 参数时序池化当视频潜空间,K600 生成 gFVD 19.16 超全部视频 VAE 基线,收敛快 6 倍。
Sora 之后的主流视频生成模型都工作在一个视频 VAE 压缩出的潜空间里。autoencoder 决定了潜空间的结构,也框死了生成质量的上限。麻烦在于,这些 VAE 的训练目标只有像素重建:潜码里存的是局部纹理、颜色、外观细节,高层语义组织基本是副产品。重建最优的潜空间,未必适合当扩散模型的学习目标,这个错位在视频里尤其贵,因为生成器要同时建模外观、运动和长程时序依赖。
图像侧的 RAE 系列已经给出反例:直接拿冻结的 DINOv3 特征当生成潜空间,扩散模型学得又快又好。视频能不能照搬,一直没人验证。障碍有三个:表征编码器输出的特征在时间轴上太密,图像编码器完全不压时间,V-JEPA 也只压 2 倍,潜序列长到 DiT 训不起;时序压缩稍有不慎就毁掉继承来的语义结构;解码器还得把跨帧运动还原连贯,不然全是抖动闪烁。
V-RAE 把「压视频」交给冻结的视觉基础模型,自己只学两个模块,外加一个不动的编码器:
池化设计的对照是全文最干净的一组实验:均值池化 0 参数,探针准确率最高(91.82%),rFVD 却烂到 94.25;3D 卷积把 rFVD 拉到 5.91,语义掉到 78.26%;67M 参数的 Q-Former 两头不占(6.87 / 84.37%,被支配)。时序注意力用 3M 参数做到 6.12 / 89.13%,是唯一的帕累托点。关键不是池化容量,是内容自适应聚合。
两个工程细节值得点名。池化输出过一层无非射 LayerNorm,γ 固定为 1:带仿射的话优化器可以靠放大 γ 逃避噪声增强训练,固定之后堵死这条捷径。生成阶段沿 RAE 的思路做维度相关的噪声调度偏移,缩放因子显式带入潜序列长度,适配 1024 维的高维潜空间,视频 VAE 一般只有 1648 维。
重建(rFVD,越低越好):
| 方法 | K600 | UCF101 |
| Wan2.1 VAE | 3.58 | 6.05 |
| HunyuanVideo VAE | 4.38 | 7.73 |
| V-RAE(V-JEPA 2.1-L) | 2.13 | 6.65 |
| V-RAE(DINOv3-L) | 2.76 | 6.12 |
K600 上比最强的视频 VAE 好 40.5%。像素级指标是另一回事:LPIPS、PSNR、SSIM 全面落后大厂 VAE,PSNR 约 28 dB 对 35 dB。帧级保真让位了,视频级分布相似度反而赢。
语义探针的差距悬殊:UCF101 上 V-RAE 90.92%,最强的 VAE 基线 30.83%;SSv2 72.91% 对 45.05%;K400 83.12% 对 53.27%。三个图像编码器变体压缩后语义损失全在 3.85 个百分点以内。
生成(同一 DiT 骨干、同一 1280 token 预算,从头训):
| 潜空间 | UCF101 gFVD | K600 gFVD |
| 最强基线(AToken / Cosmos VAE) | 143.00 | 41.66 |
| V-RAE(V-JEPA 2.1-L) | 117.86 | 19.16 |
四个变体全部超过全部 VAE 基线,领先 25 和 22.5 个点。收敛差距更大:K600 上 EUPE-B 用 3 万步达到 Wan2.2 VAE 18 万步的水平,6 倍加速。tFVD 与 gFVD 的皮尔逊相关在 K600 达 0.919,rFVD 只有 0.473。Cityscapes 未来帧预测(同一预测骨干同一预算,gFVD 111.36 对 Wan2.2 的 144.47,尽管它的 rFVD 29.29 远差于对手的 7.03。
这篇把 RAE 范式从图像扩到视频,并且证明它不只是能跑通:重建、类条件生成、未来预测三件事在同一个潜空间里都拿到了数。对训视频生成模型的人,直接含义是 tokenizer 不必从像素重建目标里从头学,冻结语义特征加两个轻量模块就能给生成器一个更容易学的空间,收敛快 56 倍在算力上是实打实的节省。
tFVD 可能比 V-RAE 本身更持久。把内部潜码换成时间相邻两码的中点再解码,算 FVD:一个不用训生成器就能算的指标,与最终生成质量的相关性远超 rFVD。挑潜空间、审 tokenizer 的人多了一个便宜的体检项。
作者自认三条:实验停在 UCF101/K600 级别的受控基准和中等规模 DiT,开放域大规模文生视频(更高分辨率、更长视频、更大骨干)未验证;四个编码器没有系统拆解各自预训练目标的贡献;语义保持与生成质量的正相关是关联观察,机理没讲清。
读下来另有两点要保留。像素级保真全面落后,高保真修复、视频压缩这类场景用不上。潜通道 1024 维,生成侧用 token 预算拉平了对比,autoencoder 却没拉平:ViT-XL 解码器和输入输出投影都不便宜,论文没有给端到端推理成本的对照。tFVD 的相关性也是在十来个 tokenizer 的小样本上算的,换个模型家族未必还有 0.9。