阿里发布 Qwen-Audio-3.0-TTS,支持 16 语言与 3 分钟单次生成
Alibaba_Qwen · x · 2026-07-23
阿里通义发布了 Qwen-Audio-3.0-TTS,这是一个新的文本转语音模型,分为两种版本:Flash 面向实时交互,Plus 面向更高质量生成。
这次更新的重点包括:
- 可用细粒度内联标签控制语气,比如 [whisper]、[angry]、[breaths]、[laughs]
- 也支持自然语言指令,比如“像睡前故事一样慢慢读”
- 支持 16 种语言
- 对嘈杂参考音频的输出更稳
- 可在 单次生成 中完成最长 3 分钟的长音频
阿里还称,这个模型已经排到 Artificial Analysis TTS 榜单第 1 名。
「多模态」频道最新
- Reddit 用户称 LTX 2.3 音频比 TTS 更会做呼吸、笑声和语调变化 — cptrios · 2026-07-23
- 开源节点式 LoRA 训练器把打标、续训和显存监控放进一张图 — ashishsanu · 2026-07-23
- TERRA-129 作为 AI 动画科幻短片亮相,署名 Matygoo — Matygoo1 · 2026-07-23
- 有人认为 Kling AI 的近景表情更自然 — burny_tech · 2026-07-23
- FameGrid Krea 2 试图生成更像真人发布的社媒图片 — UltraMuseArt · 2026-07-23
- 一段可复用的 ChatGPT 图片提示词:真人加涂鸦影子双人像 — SimplyAnnisa · 2026-07-23