阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型
阿里通义实验室正式发布了语音合成大模型 Qwen-Audio-3.0-TTS。该模型主打多语种支持与高度可控的语音生成能力,进一步降低了实时语音交互的延迟门槛。
版本与核心参数
模型提供两个版本以满足不同场景需求:Flash 版面向实时交互,首包延迟约为 300ms 级别;Plus 版则面向更高质量的生成任务,在自然度和音色还原度上表现更优。
多语言与音色能力
在多语言能力上,Qwen-Audio-3.0-TTS 支持 16 种语言和 20 种方言。用户仅需提供一段参考音频,模型即可实现跨语种说话并保持同一音色。
可控性与风格指令
该模型具备极强的可控性。用户不仅可以通过自然语言控制语音的语气和风格,还能在文本中嵌入如 `[gasp]` 等细粒度标签来实现更精确的情感与声音细节表达。
2026-07-20 ~ 2026-07-21 · 5 条相关
- 第 1 集:阿里Qwen-Audio-3.0-TTS-Plus登顶语音榜(2026-07-15,2 条)
- 第 2 集:阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型(2026-07-20,5 条)
- 【源头】千问发布Qwen-Audio-3.0-TTS — 千问大模型 · 2026-07-20
- Qwen-Audio-3.0-TTS 发布 — airesearch12 · 2026-07-21
- 【源头】通义发布 Qwen-Audio-3.0-TTS,一段参考音可说 16 种语言 — xiaohu · 2026-07-21