通义千问发布Qwen-Audio-3.0音频生成预览版技术报告

udmrzn · x · 2026-07-31

阿里巴巴通义千问团队发布了 Qwen-Audio-3.0-Gen-Preview 技术报告。该模型采用统一的非自回归框架,结合扩散Transformer(DiT)和共享变分自编码器(VAE),能够直接生成包含语音、音乐、音效和多重角色的完整混合长波形。

模型通过共享连续 VAE 将 48kHz 立体声压缩为 25Hz 潜在序列,并引入语义监督。评测结果显示,其在 Seed-TTS-Eval 中表现出卓越的说话人相似度,在多说话人基准测试中具有比 Seed-Audio-1.0 更高的跨轮次一致性,并在 AudioCaps 测试中展现出更强的时序定位能力。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →