VideoRAE改进视频生成潜空间

Zhihao Xie · hf · 2026-07-20

VideoRAE 试图用冻结的视频基础模型表示来替代传统 3D-VAE 作为视频生成的潜空间。

核心思路是:

实验表明,VideoRAE 在重建质量上表现强,并在 UCF-101 上取得新的 SOTA:AR 和 DiT 生成器的 class-to-video gFVD 分别为 40 和 93;训练收敛速度约比对比 3D-VAE 基线 快 5 倍。在一个 2B 规模文本到视频实验中,用 VideoRAE 替换 LTX-VAE 后也带来更快收敛。模型和代码将开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →