V-RAE:基于视觉表征的视频生成新范式
sainingxie · x · 2026-08-27
针对视频生成仍依赖传统 VAE 压缩、潜在空间难以生成的问题,论文提出 V-RAE。它直接在冻结的视觉基础模型表征上构建紧凑的生成潜在空间,通过轻量级时序池化移除冗余。在 K600 上,V-RAE 达到 2.13 rFVD,收敛速度提升 6 倍。研究还引入了 tFVD 指标来诊断时间一致性。
所属事件:V-RAE:基于视觉基础模型表征的视频生成新范式(2 条相关)→
「多模态」频道最新
- 用 Turbo LoRA 制作奥菲斯短片,流程全公开 — EasternAd8821 · 2026-08-27
- 用 Logic Pro 将任意立体声轨转为空间音频 — BLCNYY · 2026-08-27
- MiniMax 搭配 Suno 打造原创 AI 音乐视频 — HowToSD · 2026-08-27
- ECCV 2026:FixAnything 用视频模型修复任意 3D 渲染 — orlitany · 2026-08-27
- 含 9000 图的文生图基准发布,测 52 模型 — dh7net · 2026-08-27
- Wulver v0.1 发布:基于 Krea 2 的二次元微调模型 — KayDaxter · 2026-08-27