牛津与 NUS 推出 V-RAE:用预训练视觉表征替代像素重建做视频生成
jiqizhixin · x · 2026-09-03
牛津大学与新加坡国立大学提出 V-RAE(Video Representation Autoencoder),重新思考视频生成的基础。
- 现有视频生成器都先把视频压缩进 latent 空间,但传统 VAE 优化的是像素重建——忠实还原真实视频与易于生成新视频是两回事。
- V-RAE 完全跳过像素重建目标,直接用预训练视觉模型学到的高层语义表征作为生成空间,将图像领域的 RAE 思路扩展到视频。
- 这样扩散模型学习的 latent 空间具有丰富的语义结构,而非仅为纹理保真度优化。
- 作者在 Kinetics-600 上展示了效果(正文截断,具体数字见原文)。
「多模态」频道最新
- MiniMax H3开源一个月:开发者用其构建生成式视频课堂,可实时讲解任意概念 — alejandroll10 · 2026-09-03
- ComfyUI 公布 MiniMax H3 同步配音挑战赛获奖者 — MiniMax_AI · 2026-09-03
- Wan 2.2 图生视频实测:双阶段采样让鲁本斯油画动起来 — VictorVisuals · 2026-09-03
- AI 虚拟网红加速渗透内容创作,Seedance 主打 influencer vlog 生成 — aftahi_ai · 2026-09-03
- Seedance 2.5 实测:30 秒 AI 网红 Vlog 身份一致、动作自然 — aftahi_ai · 2026-09-03
- AI 生成肖像:荧光粉黄配色下「不容共识」的讥讽冠冕头像 — misovalko · 2026-09-03