VideoRAE改进视频生成潜空间
Zhihao Xie · hf · 2026-07-20
VideoRAE 试图用冻结的视频基础模型表示来替代传统 3D-VAE 作为视频生成的潜空间。
核心思路是:
- 从冻结的视频基础模型中提取多尺度层级特征;
- 用轻量 1D self-attention projector 压缩成更适合生成的潜变量;
- 既支持给 Diffusion Transformer 用的连续 latent,也支持给自回归模型用的离散 token。
实验表明,VideoRAE 在重建质量上表现强,并在 UCF-101 上取得新的 SOTA:AR 和 DiT 生成器的 class-to-video gFVD 分别为 40 和 93;训练收敛速度约比对比 3D-VAE 基线 快 5 倍。在一个 2B 规模文本到视频实验中,用 VideoRAE 替换 LTX-VAE 后也带来更快收敛。模型和代码将开源。
「多模态」频道最新
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 手绘手办丢进 Seedance,效果像真的“活过来” — cocktailpeanut · 2026-07-22
- 一个 AI agent 做出的沼泽乡村 MV 在 Reddit 上走红 — LazyKaleidoscope4696 · 2026-07-22
- 实测 Qwen 3 图像生成:地图边界随提问视角变化,自带中文标签 — NirantK · 2026-07-22
- 独立开发者把对着屏幕吐槽,做成了本地 MCP 报 bug 工具 — phdptsd · 2026-07-22
- Google 演示称 Gemma 4 可在 6 秒内识别车损视频 — soumitrashukla9 · 2026-07-22