Qwen 语音双线拆解:云端可租的 Audio-3.1 与本地可跑的 TTS/ASR
lmoroney · x · 2026-10-10
Laurence Moroney 撰文厘清「Qwen 新语音模型」的两种含义,并给出搭建全本地语音闭环的思路。
可租的云端线:Qwen-Audio-3.1
- 五款托管模型:ASR、ASR-Next、TTS、TTS-Next、Realtime,全部仅 API,无开放权重,未公布参数量。
- Realtime 是主打:全双工、流式输入输出,边说边听并支持打断;支持函数调用、联网搜索、克隆音色与 8 种新系统音色,走 WebSocket/WebRTC/AOQ;可中途切换语言并识别情绪与意图;上下文 262,144 token,单会话最多 50 轮音频或累计 300 秒。
- TTS-Next 被称「AudioGen」,一次生成语音、音效与环境声;最多 3000 输入字符、播客输出最长 240 秒、最多 3 段 30 秒参考音频,中英双语,非流式。
- ASR 覆盖 30 种语言与 16 种中文方言。
可跑的本地线:Qwen3-TTS 与 Qwen3-ASR
- 2026 年 1 月发布的开源权重语音模型,Apache-2.0 许可,可在自己机器上运行。
- 作者对比两条路线各自能做什么、目前验证到什么程度,并说明如何把本地 TTS 与 ASR 串成完整语音回路。
所属事件:Qwen 语音双线布局:云端可租 Audio-3.1,本地可自部署 TTS/ASR(3 条相关)→
「Infra」频道最新
- dotConf 演讲回放:用投机解码加速 llama.cpp 推理 — ngxson · 2026-10-10
- 德累斯顿芯片厂或走无EUV路线,浸润式多重曝光可撑7nm — pstAsiatech · 2026-10-10
- 三星开源 LittleBit:13B 模型极限量化压进 1GB 内存 — udmrzn · 2026-10-10
- 分析师称 agentic CPU 研究与 NVIDIA Vera 基准结论一致,关注扩展路径之争 — BenBajarin · 2026-10-10
- Container 运行时 P95 延迟降至 731ms,两周再快 180ms — ritakozlov · 2026-10-10
- 亚马逊跟进微软宣布弃用数据中心交易保密协议,社区反对已致数百项暂停令 — TechCrunch AI · 2026-10-10