MIT 开源 Kandinsky 6 视频模型:6 个变体、音画同生、Diffusers 日零集成
RisingSayak · x · 2026-10-06
Kandinsky Lab(MIT 开源权重)发布 Kandinsky 6 视频生成模型家族,Hugging Face Diffusers 提供 day-0 集成。
要点:
- 主模型基于单一多模态扩散 Transformer,从文本或参考图像同时生成视频与同步音频:视频和音频 latent 通过融合块互相 cross-attention 联合去噪,各自以独立的 Qwen2.5-VL 文本分支和 CLIP pooled embedding 为条件。
- 另有单独的超分辨率模型,在因果 3D K-VAE 的 latent 空间逐 tile 放大生成视频。
- 共 6 个变体,在速度、显存与质量之间权衡;官方还提供 flow-matching 与蒸馏版本,以及两个超分 checkpoint。
所属事件:Kandinsky 6.0 Video开源:音视频同步生成,MIT协议放全权重(4 条相关)→
「多模态」频道最新
- 单词出图:Diaphanous 一词生成轻盈剔透的 Midjourney v8.2 图 — tisch_eins · 2026-10-06
- 《公主与龙》经典故事 AI 重新演绎成视频 — Throwaway350750 · 2026-10-06
- Veda 稀疏注意力 ComfyUI 节点:12GB 显存渲染 5 秒视频快 2.9 倍 — lmoroney · 2026-10-06
- invideo 推出 MCP:接 250+ 模型搞定文生视频全流程 — aziz4ai · 2026-10-06
- AI 剧集《Time Travel Tiffany》发布第二集 — CavalierArcher · 2026-10-06
- Higgsfield 宣称所有爆款 AI 网红皆出自其平台,遭讽从好莱坞转向造假网红 — kyliebytes · 2026-10-06