OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen, Wenbo Zhang, Kexin Huang, Qi Luo, Zhe Xu, Ying Zhu, Jin Wang, Tengyue Zhang, Qi Chen, Cheng Chang, Songlin Wang, Junqi Dai, Jiasheng Ye, Xiaogui Yang, Tianyi Liang, Xiangyu Peng, Zhaoye Fei, Shimin Li, Qinyuan Cheng, Xie Chen, Xinchi Chen, Xipeng Qiu
cs.SD, cs.CV
2026-07-27
OmniVAE 让音视频 VAE 联合训练,用段级对比对齐潜空间、用语义蒸馏增强各自,下游文生音视频的同步与质量都更强,推理零额外开销。
让模型从一句文字同时生成画面和配音,难点不在画面或声音各自的质量,而在两者要对得上:狗叫的时候嘴在动,雨打在不同的物体上。现在的做法是视频 VAE 和音频 VAE 各自单独训练、只管重建,两个潜空间(latent space)谁也不认识谁,跨模态的同步关系只能留给下游生成器从头学,效果差且难训。OmniVAE 要把跨模态对齐直接做进 tokenizer 这一层。
OmniVAE 保留各自独立的视频 VAE(基于 Wan2.2 backbone)和音频 VAE(DAC 风格),重建能力不动。在此之上加两个只在训练时生效、推理零开销的目标。
第一个是段级音视频对比学习。把一段音视频切成 48 个 1/6 秒的片段,视频潜变量先用一个轻量 Transformer 做空间聚合再时间池化,音频用 ConvNeXt-1D 沿时间聚合,都映射到同一维度。然后用双向 InfoNCE 损失对比:同一时间段的音视频为正样本,其余为负。负样本分三级构造,片段内(同 clip 不同时段)、兄弟 clip(同源视频不同片段)、跨视频,粗略 2:2:1,既逼出细粒度时序判别,又保证语义多样性。
第二个是单模态语义蒸馏。冻结 Qwen3-Omni 的视觉编码器(第 27 层)和音频编码器(第 18 层)当老师,用 sigmoid-cosine 损失把它们的语义特征蒸馏进各自的潜空间,让每个潜空间单独也更好学。两个分支共约 1.08B 参数(推理时保留),训练时多出约 49M 的对比头和投影器,训练完丢弃。
训练分三阶段:先各自只重建预训练;再加对比和蒸馏联合训(显存大,去掉判别器);最后冻结音频编码器、只微调音频解码器恢复对抗监督,修掉联合训练引入的轻微电子声瑕疵。
下游验证用同步探测(sync probing,预测音视频时序偏移)和真实文生音视频(Verse-Bench)。同步探测 A@1(VGS-Sp):只重建 6.4,加对比 18.1,OmniVAE 20.2(冻结),微调聚合器后 22.3。对比学习是时序对齐的主要来源。
文生音视频(Verse-Bench,CFG=5,末三个 checkpoint 均值):
| 配置 | Desync↓ | LSE-C↑ | WER↓ |
| Recon | 0.884 | 1.479 | 0.243 |
| Recon+Distill | 0.814 | 1.450 | 0.205 |
| Recon+AVCLIP | 0.576 | 1.970 | 0.172 |
| OmniVAE | 0.570 | 2.093 | 0.168 |
对比项降 Desync、升 LSE-C(唇同步)和音视频语义一致;蒸馏项改善音频质量(WER、IS)。两者互补,合起来最强。重建质量在视频侧基本不掉,音频侧对比项有轻微代价但仍是最好的一档。
音视频联合生成是 Sora 2、Veo 3 这一代闭源系统的招牌能力,开源方案一直追得吃力。这篇把瓶颈定位在 tokenizer 这一层而非生成器,思路清晰:与其让生成器从头学同步,不如让潜空间天生就编码了同步关系。对做音视频生成的开源团队,这是一个可即插即用的基础组件,权重和代码都放出了,且推理不增加开销。
重建和跨模态对齐之间存在张力:加上对比学习后音频重建指标明显下滑(如 STOI 从 0.9981 掉到 0.9948),得靠第三阶段专门补救。所有结论在一个固定的下游生成模型上验证,作者也承认要等更大规模生成模型再确认收益。Verse-Bench 的 Set3 唇同步因为生成分辨率只有 256×256、人脸太小,专门改写了 prompt 才能测,和原版 prompt 不可直接比。验证主要在 8 秒、24fps 的 clip 上。