V-RAE:基于视觉表征的视频生成新范式

sainingxie · x · 2026-08-27

针对视频生成仍依赖传统 VAE 压缩、潜在空间难以生成的问题,论文提出 V-RAE。它直接在冻结的视觉基础模型表征上构建紧凑的生成潜在空间,通过轻量级时序池化移除冗余。在 K600 上,V-RAE 达到 2.13 rFVD,收敛速度提升 6 倍。研究还引入了 tFVD 指标来诊断时间一致性。

所属事件:V-RAE:基于视觉基础模型表征的视频生成新范式(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →