KVAE多模态分词器:全面超越现有图视频音频开源VAE

NielsRogge · x · 2026-08-10

arXiv 的一篇新论文提出了专为潜在生成模型设计的 KVAE 分词器家族,涵盖音频、图像和视频。研究表明,潜在空间的结构比单纯的重建质量更能决定下游生成效果。实验显示,KVAE 在主客观指标上均匹配或超越了 Wan-2.2、FLUX.2、MovieGen 等前沿开源分词器。研究团队还开源了代码,并分享了模型选择方法与设计消融实验的细节。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →