KVAE: Family of Tokenizers for Multimodal Generative Models
Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov
cs.CV, cs.LG, cs.SD
2026-08-06
Kandinsky 推出面向潜在扩散的音频/图像/视频三套连续 tokenizer,同等压缩比下重建普遍优于 Wan、FLUX、HunyuanVideo,代码与权重全开源。
潜在扩散模型(latent diffusion)生成图片、视频、音频时,都要先把原始信号压进一个低维潜空间,再让扩散模型在里面生成。负责压缩这一步的 tokenizer(VAE 的一种)直接决定生成质量、训练速度和下游模型能不能学得动。长期以来,评测 tokenizer 只看「重建得像不像」,也就是 PSNR、LPIPS 这类指标。这篇指出重建分高并不代表下游生成好,学术界把这种冲突叫「重建-生成困境」(reconstruction-generation dilemma)。Kandinsky Lab 这篇技术报告同时给出三个模态的 tokenizer(音频、图像、视频),并围绕一个核心概念组织全文:diffusability,即一个潜空间对扩散建模到底友不友好。
报告推出三套连续潜空间 tokenizer:
几个关键设计选择值得讲清楚。非对称编解码器:4×16×16 版本把解码器做宽、把编码器通道收窄,解码器参数量是编码器的 5.3 倍,理由是解码器要承担更高的生成能力。通道数是最锋利的重建-生成旋钮:通道越多重建越好,但下游扩散模型反而更难收敛。报告最后明确,64 通道是「在 0.6B 生成器这个尺度下的最优」,不是音频潜空间的固有属性。
视频重建(MCL-JCV 720p 数据集):
| 模型 | 压缩比 | 通道 | PSNR |
| KVAE-3D | 4×8×8 | 16 | 36.0 |
| HunyuanVideo-1.0 | 4×8×8 | 16 | 34.3 |
| Wan-2.1 | 4×8×8 | 16 | 34.3 |
| KVAE-3D | 4×16×16 | 64 | 35.2 |
| HunyuanVideo-1.5 | 4×16×16 | 32 | 34.4 |
| Wan-2.2 | 4×16×16 | 48 | 34.2 |
同等压缩比下,KVAE 的 PSNR 高出约 1 dB,SSIM 也领先。
图像重建(OmniDoc-TokenBench,3042 张图):KVAE-2D-2.0 的 PSNR 28.05、SSIM 0.957,高于 FLUX.1-dev(26.24)和 FLUX.2-dev(27.72)。但 KVAE 的 FID(1.74)反而不如 FLUX 两版(0.55、0.73),重建并非全面碾压。
音频是最干净的一档。重建上(AudioSet),KVAE-Audio 的 MEL 距离 0.537、STFT 1.770,均优于 MMAudio、MovieGen 的 DACVAE 和 SAME-L,而参数量只有 166.9M(SAME-L 是 852.1M)。作为对照,MMAudio 的 VAE 在 SI-SDR 上报出 -32.08 这种近乎崩溃的数。生成端(AudioCaps)KVAE-Audio 在 CLAP(0.344)、CE、感知质量和 FAD 上全部领先,人工 side-by-side 对比对各基线的胜率在 0.54 到 0.74 之间。
Kandinsky Lab 把这三套 tokenizer 的权重、训练细节和消融全放出来了,等于给想自己搭潜在扩散的人一份现成蓝图。数值上它对齐甚至略超 Wan-2.2、HunyuanVideo、FLUX.2、MovieGen、StableAudio、MMAudio 这些前沿开源 tokenizer。对从业者更值钱的是方法论层面的判断:选 tokenizer 不能只盯重建指标,而要看它给下游扩散留出的 diffusability;以及通道数、编解码器对称性这些旋钮怎么在重建和生成之间权衡。这些都是踩过坑才说得出来的。
论文自己点了几条。最关键的是所有「持平前沿」的结论来自作者自己的评测和自家的下游生成器(0.6B 音频、2B 图像),没有第三方复现,也没有与闭源系统直接对照。图像侧 KVAE 在 FID、LPIPS 上其实输给 FLUX,所谓全面领先并不成立。报告也承认,用模型打分的审美评估器(aesthetic predictor)本身就受被评系统建模选择的影响,不算独立。最后,64 通道这个结论只在 0.6B 尺度下成立,放大到更大生成器会怎样没有验证。