阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型

阿里通义实验室正式发布了语音合成大模型 Qwen-Audio-3.0-TTS。该模型主打多语种支持与高度可控的语音生成能力,进一步降低了实时语音交互的延迟门槛。

版本与核心参数

模型提供两个版本以满足不同场景需求:Flash 版面向实时交互,首包延迟约为 300ms 级别;Plus 版则面向更高质量的生成任务,在自然度和音色还原度上表现更优。

多语言与音色能力

在多语言能力上,Qwen-Audio-3.0-TTS 支持 16 种语言和 20 种方言。用户仅需提供一段参考音频,模型即可实现跨语种说话并保持同一音色。

可控性与风格指令

该模型具备极强的可控性。用户不仅可以通过自然语言控制语音的语气和风格,还能在文本中嵌入如 `[gasp]` 等细粒度标签来实现更精确的情感与声音细节表达。

2026-07-20 ~ 2026-07-21 · 5 条相关

事件全程(共 2 集)→

另有 2 条近重复转述:通义实验室 · 智东西