Qwen-Audio-3.0-TTS 发布
智东西 · wechat · 2026-07-20
阿里千问发布了新的语音合成模型 Qwen-Audio-3.0-TTS,分为两个版本:
- Flash:面向实时交互,首包延时达到 300ms 级别
- Plus:面向高质量生成
这次升级重点是更强的可控性。模型支持通过结构化标签控制语气、情绪和呼吸,例如 [gasp]、[giggles]、[angry];同时也支持用自然语言直接描述角色、场景、语速和情绪,不必手动调一堆音频参数。
官方还给出了多项能力提升:
- 覆盖 16 种语言,新增阿拉伯语、越南语、马来语、菲律宾语
- 在第三方测试中,系列模型在 16 种语言里有 10 种拿到字/词错误率第一
- Qwen-Audio-3.0-TTS-Plus 在 16 种语言的说话人相似度上全部最优
- 支持 20 种中文方言,并强化了韵律、声调和口语表达
- 在噪声/混响参考音频下,声音复刻能力更强
- 采样率提升到 48kHz,单次最长可合成 3 分钟
目前 Plus 和 Flash 都已在 阿里云百炼 开放。
所属事件:阿里发布 Qwen-Audio-3.0-TTS 语音大模型(5 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11