千问一口气发布五款语音模型,ASR 直降 95%
千问大模型 · wechat · 2026-09-23
阿里巴巴千问正式发布 Qwen-Audio-3.1 系列,五款模型覆盖「理解-生成-交互-创作」:ASR、TTS、Realtime 全面升级,并新增音频理解模型 ASR-Next 和音频创作模型 TTS-Next。全线降价:TTS 降约 70%,Realtime 降约 85%,ASR 降达 95%。
要点
- ASR:支持 30 种语言、16 种中文方言,方言平均 CER 10.38%,新增原生转写润色与分角色结构化转写,流式首字延迟约 160ms
- ASR-Next:扩展到泛音频理解,可识别情绪、环境声与机械声,支持音频问答与事件定位
- TTS:同一音色跨语言自然迁移,支持指令控制情绪语速
- TTS-Next:从语音合成扩展为通用音频生成,统一输出人声、音效与环境音,支持 48kHz 与时间戳控制
- Realtime:全双工交互,可插话打断,理解情绪意图,支持多语言实时切换与对话中调用 Agent 工具
API 已上架千问 AI 平台,并与 Qoder、千问办公等 Agent 及多款 AI 眼镜等硬件结合。
所属事件:千问发布五款语音模型,ASR 价格直降 95%(4 条相关)→
「多模态」频道最新
- 博主称 Opus 5.5 一次性生成完整 newsletter 上线视频 — alex_verem · 2026-09-23
- PixVerse R2 实测:视频模型不再是片段,而是能 WASD 走进去的世界 — HeyAmit_ · 2026-09-23
- 一人包揽 AI 音乐 MV:作者实测全流程,称「单人制片厂」不到一年 — kraussian · 2026-09-23
- MiniMax H3 Ref2VA 实测:第 8 张参考图触发初始化卡死 — itchplease · 2026-09-23
- H3 长视频画质衰减有解:二次精修注入噪声稳住 latent — xyzdist · 2026-09-23
- 开发者用 Codex+GPT Image 2.5 自动生成角色替换 LoRA 数据集 — ostrisai · 2026-09-23