阿里发布 Qwen-Audio-3.0-TTS,支持 16 语言与 3 分钟单次生成
Alibaba_Qwen · x · 2026-07-23
阿里通义发布了 Qwen-Audio-3.0-TTS,这是一个新的文本转语音模型,分为两种版本:Flash 面向实时交互,Plus 面向更高质量生成。
这次更新的重点包括:
- 可用细粒度内联标签控制语气,比如 [whisper]、[angry]、[breaths]、[laughs]
- 也支持自然语言指令,比如“像睡前故事一样慢慢读”
- 支持 16 种语言
- 对嘈杂参考音频的输出更稳
- 可在 单次生成 中完成最长 3 分钟的长音频
阿里还称,这个模型已经排到 Artificial Analysis TTS 榜单第 1 名。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11