Kandinsky 实验室发布 KVAE:多模态生成模型全系列分词器
kandinskylab · hf · 2026-08-08
Kandinsky 实验室发布了 KVAE 系列分词器,专为后续的文本条件生成设计,涵盖音频、图像和视频模态:
- KVAE-Audio:连续全频段 48kHz 分词器,具备 50Hz 潜在空间和 64 个通道。
- KVAE-3D:两款用于视频的因果分词器,压缩率分别为 4x16x16 和 4x8x8。
- KVAE-2D:图像模型,压缩因子为 8,包含 32 个通道。
团队表示,在主客观各项重建与生成指标上,KVAE 匹配或超越了现有的前沿开源分词器(如 Wan-2.2, FLUX.2, StableAudio 等)。此外,他们还公开了训练细节、模型选择方法及设计消融实验,代码已完全开源。
「多模态」频道最新
- Grok 图像生成能力实测:相同提示词输出差异大,整体效果显著提升 — VoidStateKate · 2026-08-08
- 用 Seedance 与 Leonardo 制作 3D 动画广告 — aziz4ai · 2026-08-08
- HeyGen 发起挑战:你能分清数字人与真人吗? — HeyGen · 2026-08-08
- 本地运行 MiniMax H3 模型:单提示词生成《蝙蝠侠大战超人》片段 — takayatodoroki · 2026-08-08
- WebAR联动AI模型:让静态老漫画动起来 — OdinLovis · 2026-08-08
- 用 MiniMax H3 复刻《老友记》:图生视频提示词实践 — leftatgreenland · 2026-08-08