Kandinsky 6.0 Video开源:音视频同步生成,MIT协议放全权重
kandinskylab · hf · 2026-10-06
Kandinsky 6.0 Video:同步音视频生成基础模型
kandinskylab 发布 Kandinsky 6.0 Video,一组文本到音视频(T2AV)与图到音视频(I2AV)的同步生成扩散模型,包含 Lite(3B) 与 Pro(29B) 两个版本,可生成 5 秒、44 kHz 同步音频的视频片段,支持唇形同步,内置超分模型可将输出提升至 1080p。
技术要点:
- 采用双流 CrossDiT 架构,将预训练视频流与新训练音频流通过双向交叉注意力连接,实现时间与语义对齐;
- 连续预训练策略:先在大规模纯音频语料上从零训练音频流,再在配对音视频数据上联合训练并保持单模态保真;之后进行 SFT、RL 后训练与蒸馏。
评测:人工对比评测中,6.0 Video Pro 明显优于上代 5.0 Video Pro,与领先的音视频生成模型具竞争力,语音质量尤佳。代码、权重与 diffusers 集成均以 MIT 协议开源。
「多模态」频道最新
- 创作者用 Codex 与 GPT-6 Astra 分流重复工作流 — socialwithaayan · 2026-10-06
- Qwen-Image 2.1 编辑结果常显未完成,作者晒工作流求解 — Suspicious_Aide2697 · 2026-10-06
- Midjourney 风格码 sref 705714994 可生成笔刷质感角色 — michaelrabone · 2026-10-06
- minchoi 晒以假乱真 AI 人群视频:这些人全都不是真人 — minchoi · 2026-10-06
- Runway CEO 引 Jevons 悖论:编码 Agent 正催生更多软件需求 — c_valenzuelab · 2026-10-06
- H3 视频表演迁移实测:完整 prompt 让角色演技大幅提升 — R34vspec · 2026-10-06