阿里连发五款 Qwen-Audio-3.1 语音模型,ASR 直降 95%
aigclink · x · 2026-09-23
阿里一次发布五款 Qwen-Audio-3.1 系列语音模型,并全线降价:ASR 降 95%、Realtime 降 85%、TTS 降 70%,覆盖理解、生成、创作与实时交互全链条。
- ASR:支持 30 种语言 + 16 种中文方言,原生转写润色(去语气词/语义重组)、分角色转写带时间戳、流式首字延迟约 160 毫秒
- ASR-Next:从转写扩展到理解整段音频,可识别情绪、环境声,支持音频问答
- TTS:同一音色跨语言/方言不变味,可控制情绪与语速
- TTS-Next:一次生成人声+音效+环境音的完整音频作品,48kHz 输出,瞄准播客、有声书、影视、游戏场景
- Realtime:全双工可打断、识别情绪、多语言无缝切换,并能调用 Agent 工具完成任务
作者判断:实时语音正从「功能」变成「交互入口」,将冲击客服、助手及 AI 眼镜等无屏化硬件场景。
所属事件:阿里一口气发布五款 Qwen 语音模型并大幅降价(2 条相关)→
「模型」频道最新
- Opus 5.5 一发提示词生成完整《波斯王子》关卡,含音效音乐 — iannuttall · 2026-09-23
- Opus 5.5 降价 40% 一天,社区跑出 C 转 Rust 等 8 个玩法 — alex_verem · 2026-09-23
- Beff Jezos 调侃 Opus 5.5 告别 slop 文风,读者大脑减负 — beffjezos · 2026-09-23
- Opus 5.5 一次生成完整波斯王子关卡,音画俱全 — iannuttall · 2026-09-23
- GPT-6 Sol 在 DeepSWE 上反输前代:72.7% 对 68.8% — banaxi-tech · 2026-09-23
- 模型发布疲劳:开发者称新模型提升边际化,够用就好 — Rasmic · 2026-09-23