专题 · FULL STORY

阿里Qwen-Audio-3.0-TTS从登顶到发布

阿里通义语音合成大模型Qwen-Audio-3.0-TTS先在Speech Arena榜单登顶,随后官方正式发布,主打多语种支持与低延迟的实时语音交互。

2026-07-15 ~ 2026-07-21 · 2 集 · 7 条

第 1 集 · 阿里Qwen-Audio-3.0-TTS-Plus登顶语音榜(2026-07-15,2 条)

Artificial Analysis 更新了 Speech Arena 语音榜单并开放投票与样例试听。阿里通义旗下的 Qwen-Audio-3.0-TTS-Plus 凭借出色表现成功登顶“Provider Voices”榜单。尽管该模型在生成速度方面相对落后,但其卓越的语音生成质量依然获得了高度认可。

第 2 集 · 阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型(2026-07-20,5 条)

阿里通义实验室正式发布了语音合成大模型 Qwen-Audio-3.0-TTS。该模型主打多语种支持与高度可控的语音生成能力,进一步降低了实时语音交互的延迟门槛。

版本与核心参数

模型提供两个版本以满足不同场景需求:Flash 版面向实时交互,首包延迟约为 300ms 级别;Plus 版则面向更高质量的生成任务,在自然度和音色还原度上表现更优。

多语言与音色能力

在多语言能力上,Qwen-Audio-3.0-TTS 支持 16 种语言和 20 种方言。用户仅需提供一段参考音频,模型即可实现跨语种说话并保持同一音色。

可控性与风格指令

该模型具备极强的可控性。用户不仅可以通过自然语言控制语音的语气和风格,还能在文本中嵌入如 `[gasp]` 等细粒度标签来实现更精确的情感与声音细节表达。