视频生成新范式V-RAE:重构与生成质量不一致

机器之心 · wechat · 2026-08-25

新加坡国立大学与牛津大学提出 V-RAE(Video Representation Autoencoder),重新思考视频生成的潜在空间。该方法利用冻结的视觉基础模型作为编码器,通过轻量级时间池化处理视频特征,直接将预训练的语义表征用于视频生成与预测。

核心发现与实验结果:

新指标 tFVD:

论文提出 tFVD(Temporal FVD),通过在潜在轨迹上进行局部插值来评估空间的时间平滑性和对预测误差的鲁棒性。实验表明,tFVD 与生成质量的相关性远高于传统重建指标(系数达 0.620.92),说明一个好的生成潜在空间应具备“可生成性”而非仅仅是“可重建性”。

此外,V-RAE 在未来视频预测任务中也表现出明显优势,证明该范式有助于模型学习视觉状态的转移规律。

所属事件:V-RAE:基于视觉基础模型表征的视频生成新范式(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →