专题 · FULL STORY
阿里Qwen语音大模型登顶与发布
阿里通义实验室正式发布语音合成大模型 Qwen-Audio-3.0-TTS。其增强版登顶 Speech Arena 榜单,展现出强大的多语种与低延迟语音生成能力。
2026-07-15 ~ 2026-07-22 · 3 集 · 10 条
第 1 集 · 阿里Qwen-Audio-3.0-TTS-Plus登顶语音榜(2026-07-15,2 条)
Artificial Analysis 更新了 Speech Arena 语音榜单并开放投票与样例试听。阿里通义旗下的 Qwen-Audio-3.0-TTS-Plus 凭借出色表现成功登顶“Provider Voices”榜单。尽管该模型在生成速度方面相对落后,但其卓越的语音生成质量依然获得了高度认可。
- Qwen-Audio-3.0-TTS-Plus 登顶语音榜 — ArtificialAnlys · 2026-07-15
- 语音榜单更新,Qwen 速度落后 — ArtificialAnlys · 2026-07-15
第 2 集 · 阿里发布 Qwen-Audio-3.0-TTS 语音大模型(2026-07-20,5 条)
阿里通义实验室正式发布了语音合成大模型 Qwen-Audio-3.0-TTS。该模型主打多语种支持与高度可控的语音生成能力,进一步降低了实时语音交互的延迟门槛。
版本与核心参数
模型提供两个版本以满足不同场景需求:Flash 版面向实时交互,首包延迟约为 300ms 级别;Plus 版则面向更高质量的生成任务,在自然度和音色还原度上表现更优。
多语言与音色能力
在多语言能力上,Qwen-Audio-3.0-TTS 支持 16 种语言和 20 种方言。用户仅需提供一段参考音频,模型即可实现跨语种说话并保持同一音色。
可控性与风格指令
该模型具备极强的可控性。用户不仅可以通过自然语言控制语音的语气和风格,还能在文本中嵌入如 [gasp] 等细粒度标签来实现更精确的情感与声音细节表达。
- 千问发布Qwen-Audio-3.0-TTS — 千问大模型 · 2026-07-20
- Qwen-Audio-3.0-TTS发布 — 通义实验室 · 2026-07-20
- Qwen-Audio-3.0-TTS 发布 — 智东西 · 2026-07-20
- Qwen-Audio-3.0-TTS 发布 — airesearch12 · 2026-07-21
- 通义发布 Qwen-Audio-3.0-TTS,一段参考音可说 16 种语言 — xiaohu · 2026-07-21
第 3 集 · 阿里 Qwen 最强 TTS 模型登顶但暂限 API 调用(2026-07-21,3 条)
阿里巴巴的 Qwen-Audio-3.0-TTS-Plus 模型近期登顶了 Artificial Analysis 的 Speech Arena 文本转语音排行榜,力压 Gemini 等强劲对手。然而,社区指出该最强 TTS 模型目前仅提供 API 调用服务,尚未跟进出开源权重版本。这引发了关于 Qwen 是否开始将顶尖模型商业化闭源、仅限付费 API 使用的行业讨论。
- 阿里 Qwen-Audio-3.0-TTS-Plus 登顶 Speech Arena 榜单 — airesearch12 · 2026-07-21
- 通义万相音频夺魁,但最强 TTS 模型或仅限 API 调用? — b111ue · 2026-07-22
- Qwen 最强 TTS 先上 API,开源权重暂时没跟上 — b111ue · 2026-07-22