Qwen-Audio-3.0-TTS发布

通义实验室 · wechat · 2026-07-20

阿里通义实验室发布了 Qwen-Audio-3.0-TTS 实时语音合成模型,分为两个版本:

这次更新重点解决四类生产问题:更广的多语种覆盖、更自然的自然语言指令控制、更细粒度的标签控制,以及参考音频不清晰时的鲁棒性。官方还称 Qwen-Audio-3.0-TTS-Plus 在 ArtificialAnalysis 榜单上拿到冠军。

模型支持 16 种语言 和 20 种高质量方言,可以直接用自然语言描述角色、情绪、场景和语气,也支持在文本中嵌入 [gasp]、[giggles]、[angry] 等标签做更细的表达控制。另有精品音色库、48kHz 高清输出和最长 3 分钟 单次合成能力。

所属事件:阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型(5 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →