Qwen-Audio-3.0-TTS 发布
智东西 · wechat · 2026-07-20
阿里千问发布了新的语音合成模型 Qwen-Audio-3.0-TTS,分为两个版本:
- Flash:面向实时交互,首包延时达到 300ms 级别
- Plus:面向高质量生成
这次升级重点是更强的可控性。模型支持通过结构化标签控制语气、情绪和呼吸,例如 [gasp]、[giggles]、[angry];同时也支持用自然语言直接描述角色、场景、语速和情绪,不必手动调一堆音频参数。
官方还给出了多项能力提升:
- 覆盖 16 种语言,新增阿拉伯语、越南语、马来语、菲律宾语
- 在第三方测试中,系列模型在 16 种语言里有 10 种拿到字/词错误率第一
- Qwen-Audio-3.0-TTS-Plus 在 16 种语言的说话人相似度上全部最优
- 支持 20 种中文方言,并强化了韵律、声调和口语表达
- 在噪声/混响参考音频下,声音复刻能力更强
- 采样率提升到 48kHz,单次最长可合成 3 分钟
目前 Plus 和 Flash 都已在 阿里云百炼 开放。
所属事件:阿里发布 Qwen-Audio-3.0-TTS 语音大模型(5 条相关)→
「多模态」频道最新
- 先做 3D 预演,再用手机走位生成视频 — Bart_Bialobrzeski · 2026-07-23
- Clean Plate LoRA 样例展示了视频清场工作流 — nazihater3000 · 2026-07-23
- Fish Audio S2 分支在苹果芯片上提速到 23 t/s — fogonthebarrow-downs · 2026-07-23
- Qwen-image 3.0 已接入 Runware — aziz4ai · 2026-07-23
- Reddit 用户用 ComfyUI 做出 Wan 2.2 氛围视频 — Independent-Ebb7658 · 2026-07-23
- Grok Imagine 视频生成实测:精准控制角色情绪表演 — chaitu · 2026-07-23