Qwen-Audio-3.0-TTS 发布

智东西 · wechat · 2026-07-20

阿里千问发布了新的语音合成模型 Qwen-Audio-3.0-TTS,分为两个版本:

这次升级重点是更强的可控性。模型支持通过结构化标签控制语气、情绪和呼吸,例如 [gasp]、[giggles]、[angry];同时也支持用自然语言直接描述角色、场景、语速和情绪,不必手动调一堆音频参数。

官方还给出了多项能力提升:

目前 Plus 和 Flash 都已在 阿里云百炼 开放。

所属事件:阿里发布 Qwen-Audio-3.0-TTS 语音大模型(5 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →