千问发布Qwen-Audio-3.0-TTS
千问大模型 · wechat · 2026-07-20
阿里千问正式发布语音合成大模型 Qwen-Audio-3.0-TTS,分为面向实时交互的 Flash 版和面向高质量生成的 Plus 版。
主要升级
- 细粒度标签控制:可在文本中嵌入 [gasp]、[giggles]、[angry] 之类标签,精确控制呼吸、情绪和语气细节。
- 自由风格指令控制:支持用自然语言描述角色、情绪、场景和语速,不需要掌握专业声学标注。
- 多语种覆盖:支持中、英、日、韩、德等 16 种语言,并新增阿拉伯语、越南语、马来语、菲律宾语。
- 方言合成:覆盖广东、重庆、东北、陕西、上海、四川、云南等 20 种方言。
- 复杂声学鲁棒性:针对带噪、混响的参考音频做了增强,提升语音克隆稳定性。
结果与可用性
- 官方称 Qwen-Audio-3.0-TTS-Plus 在 ArtificialAnalysis 榜单拿到冠军。
- 在 16 语种评测里,家族模型在 10 种语言上达到 SOTA;在说话人相似度测试中,Plus 包揽全部最优,Flash 也拿到 15 项第二。
- 模型已在阿里云百炼和项目博客开放体验。
所属事件:阿里发布 Qwen-Audio-3.0-TTS 语音大模型(5 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11