东京大学提出 EVA:一个线性层让 VAE 重回序列生成一线

RichmanRonald · x · 2026-10-07

东京大学 Kaede Shiohara 提出 Empirical Variational Autoencoder(EVA),通过在因果解码器骨干上增加一个预测下一个先验的线性层,用自预测自回归潜变量先验替代 VAE 固定的标准高斯先验,使先验与后验更匹配,从而无需 VQVAE 的量化或扩散模型的迭代采样即可实现高效祖先采样。

在 ImageNet 256×256 与 VGGSound 上,EVA 以更少的推理参数和更快的推理时间取得与 AR-Diffusion 等基线相当的生成保真度,可生成图像与音频样本。从 VAE 到 EVA 只需四步:解码器因果化、重建输入 token 并预测下一先验、最小化后验与预测先验的 KL 散度、推理时祖先采样并因果解码。

所属事件:东京大学提出EVA框架:一个线性层让VAE重返序列生成一线(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →