Kandinsky 实验室发布 KVAE:多模态生成模型全系列分词器

kandinskylab · hf · 2026-08-08

Kandinsky 实验室发布了 KVAE 系列分词器,专为后续的文本条件生成设计,涵盖音频、图像和视频模态:

团队表示,在主客观各项重建与生成指标上,KVAE 匹配或超越了现有的前沿开源分词器(如 Wan-2.2, FLUX.2, StableAudio 等)。此外,他们还公开了训练细节、模型选择方法及设计消融实验,代码已完全开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →