千问发布Qwen-Audio-3.0-TTS
千问大模型 · wechat · 2026-07-20
阿里千问正式发布语音合成大模型 Qwen-Audio-3.0-TTS,分为面向实时交互的 Flash 版和面向高质量生成的 Plus 版。
主要升级
- 细粒度标签控制:可在文本中嵌入 [gasp]、[giggles]、[angry] 之类标签,精确控制呼吸、情绪和语气细节。
- 自由风格指令控制:支持用自然语言描述角色、情绪、场景和语速,不需要掌握专业声学标注。
- 多语种覆盖:支持中、英、日、韩、德等 16 种语言,并新增阿拉伯语、越南语、马来语、菲律宾语。
- 方言合成:覆盖广东、重庆、东北、陕西、上海、四川、云南等 20 种方言。
- 复杂声学鲁棒性:针对带噪、混响的参考音频做了增强,提升语音克隆稳定性。
结果与可用性
- 官方称 Qwen-Audio-3.0-TTS-Plus 在 ArtificialAnalysis 榜单拿到冠军。
- 在 16 语种评测里,家族模型在 10 种语言上达到 SOTA;在说话人相似度测试中,Plus 包揽全部最优,Flash 也拿到 15 项第二。
- 模型已在阿里云百炼和项目博客开放体验。
所属事件:阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型(5 条相关)→
「模型」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 2026 IMO 上拿到 30/42 — NVIDIAAI · 2026-07-22
- OpenAI 传将向美国政界简报下一代模型家族 — kimmonismus · 2026-07-22
- Muse Spark 1.1 在 Text Arena 跑到 1495 分,性价比很突出 — ycombinator · 2026-07-22
- 教授提醒:最先进的大模型正变得无法相互替代 — emollick · 2026-07-22
- 实测吐槽谷歌 Gemini 全家桶:无一款模型能胜任核心工作负载 — bindureddy · 2026-07-22
- 曝某模型支持百万 token 上下文,价格低至 $0.33 — MickeySteamboat · 2026-07-22