通义千问发布Qwen-Audio-3.0音频生成预览版技术报告
udmrzn · x · 2026-07-31
阿里巴巴通义千问团队发布了 Qwen-Audio-3.0-Gen-Preview 技术报告。该模型采用统一的非自回归框架,结合扩散Transformer(DiT)和共享变分自编码器(VAE),能够直接生成包含语音、音乐、音效和多重角色的完整混合长波形。
模型通过共享连续 VAE 将 48kHz 立体声压缩为 25Hz 潜在序列,并引入语义监督。评测结果显示,其在 Seed-TTS-Eval 中表现出卓越的说话人相似度,在多说话人基准测试中具有比 Seed-Audio-1.0 更高的跨轮次一致性,并在 AudioCaps 测试中展现出更强的时序定位能力。
「多模态」频道最新
- 单张 LoRA 能否塞入多个概念?开发者探讨多风格训练技巧 — Lounlysoul007 · 2026-07-31
- Fish Audio 获 5200 万美元融资,发布 S2.1 Pro 语音模型 — thisdudelikesAI · 2026-07-31
- KalpaLabs 发布对话语音模型,推进通用音频架构 — ycombinator · 2026-07-31
- FLUX 3 预览版上线,Nous Research 联合发起短片创作赛 — NousResearch · 2026-07-31
- LoRA训练入门:如何为不同元素图片构建数据集? — Mean-Crab1827 · 2026-07-31
- 图像 LoRA 训练特征污染:为何其他物体也被强行套用? — FourtyMichaelMichael · 2026-07-31