V-RAE:基于视觉基础模型表征的视频生成新范式
新加坡国立大学与牛津大学联合提出 V-RAE(Video Representation Autoencoder),重新思考视频生成的潜在空间。该方法以冻结的视觉基础模型作为编码器,直接在其表征上构建紧凑的生成潜在空间,并通过轻量级时序池化移除冗余,摆脱对传统 VAE 压缩的依赖。实验在 K600 等数据集上验证,显示其重构与生成质量存在不一致现象,为视频生成提供了新思路。
2026-08-25 ~ 2026-08-27 · 2 条相关
- 视频生成新范式V-RAE:重构与生成质量不一致 — 机器之心 · 2026-08-25
- V-RAE:基于视觉表征的视频生成新范式 — sainingxie · 2026-08-27