V-RAE:基于视觉基础模型表征的视频生成新范式

新加坡国立大学与牛津大学联合提出 V-RAE(Video Representation Autoencoder),重新思考视频生成的潜在空间。该方法以冻结的视觉基础模型作为编码器,直接在其表征上构建紧凑的生成潜在空间,并通过轻量级时序池化移除冗余,摆脱对传统 VAE 压缩的依赖。实验在 K600 等数据集上验证,显示其重构与生成质量存在不一致现象,为视频生成提供了新思路。

2026-08-25 ~ 2026-08-27 · 2 条相关