Qwen-Audio-3.0-TTS发布
通义实验室 · wechat · 2026-07-20
阿里通义实验室发布了 Qwen-Audio-3.0-TTS 实时语音合成模型,分为两个版本:
- Flash:面向实时交互,首包延迟约 300ms。
- Plus:面向高质量生成,在自然度和音色还原度上更强。
这次更新重点解决四类生产问题:更广的多语种覆盖、更自然的自然语言指令控制、更细粒度的标签控制,以及参考音频不清晰时的鲁棒性。官方还称 Qwen-Audio-3.0-TTS-Plus 在 ArtificialAnalysis 榜单上拿到冠军。
模型支持 16 种语言 和 20 种高质量方言,可以直接用自然语言描述角色、情绪、场景和语气,也支持在文本中嵌入 [gasp]、[giggles]、[angry] 等标签做更细的表达控制。另有精品音色库、48kHz 高清输出和最长 3 分钟 单次合成能力。
所属事件:阿里发布 Qwen-Audio-3.0-TTS 语音大模型(5 条相关)→
「多模态」频道最新
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11