专题 · FULL STORY
阿里Qwen-Audio-3.0-TTS从登顶到发布
阿里通义语音合成大模型Qwen-Audio-3.0-TTS先在Speech Arena榜单登顶,随后官方正式发布,主打多语种支持与低延迟的实时语音交互。
2026-07-15 ~ 2026-07-21 · 2 集 · 7 条
第 1 集 · 阿里Qwen-Audio-3.0-TTS-Plus登顶语音榜(2026-07-15,2 条)
Artificial Analysis 更新了 Speech Arena 语音榜单并开放投票与样例试听。阿里通义旗下的 Qwen-Audio-3.0-TTS-Plus 凭借出色表现成功登顶“Provider Voices”榜单。尽管该模型在生成速度方面相对落后,但其卓越的语音生成质量依然获得了高度认可。
- Qwen-Audio-3.0-TTS-Plus 登顶语音榜 — ArtificialAnlys · 2026-07-15
- 语音榜单更新,Qwen 速度落后 — ArtificialAnlys · 2026-07-15
第 2 集 · 阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型(2026-07-20,5 条)
阿里通义实验室正式发布了语音合成大模型 Qwen-Audio-3.0-TTS。该模型主打多语种支持与高度可控的语音生成能力,进一步降低了实时语音交互的延迟门槛。
版本与核心参数
模型提供两个版本以满足不同场景需求:Flash 版面向实时交互,首包延迟约为 300ms 级别;Plus 版则面向更高质量的生成任务,在自然度和音色还原度上表现更优。
多语言与音色能力
在多语言能力上,Qwen-Audio-3.0-TTS 支持 16 种语言和 20 种方言。用户仅需提供一段参考音频,模型即可实现跨语种说话并保持同一音色。
可控性与风格指令
该模型具备极强的可控性。用户不仅可以通过自然语言控制语音的语气和风格,还能在文本中嵌入如 `[gasp]` 等细粒度标签来实现更精确的情感与声音细节表达。
- 千问发布Qwen-Audio-3.0-TTS — 千问大模型 · 2026-07-20
- Qwen-Audio-3.0-TTS发布 — 通义实验室 · 2026-07-20
- Qwen-Audio-3.0-TTS 发布 — 智东西 · 2026-07-20
- Qwen-Audio-3.0-TTS 发布 — airesearch12 · 2026-07-21
- 通义发布 Qwen-Audio-3.0-TTS,一段参考音可说 16 种语言 — xiaohu · 2026-07-21