Qwen 发布五个音频模型,TTS 降价 70%、ASR 最高降 95%
Alibaba_Qwen · x · 2026-09-23
阿里 Qwen 官宣 Qwen-Audio-3.1 系列:ASR、TTS、Realtime 全面升级,并新增 TTS-Next(音频创作)与 ASR-Next(音频理解),形成理解、生成、交互、创作五模型完整音频栈。价格大幅下调:TTS 约降 70%,Realtime 约降 85%,ASR 最高降 95%。
亮点:
- ASR:多语言与方言识别增强,原生润色功能自动去除语气词与重复,转写更干净连贯。
- ASR-Next:支持多说话人识别(带说话人标签与时间戳)、情绪与环境/机器声理解,可做声音描述、事件定位、音频问答与推理。
- TTS:多语言与方言合成,支持自然跨语言音色迁移,可通过简单指令控制情绪、语速与风格。
- TTS-Next:统一 LM + diffusion 框架(原文截断)。
所属事件:千问发布五款语音模型,ASR 价格直降 95%(4 条相关)→
「多模态」频道最新
- 博主称 Opus 5.5 一次性生成完整 newsletter 上线视频 — alex_verem · 2026-09-23
- PixVerse R2 实测:视频模型不再是片段,而是能 WASD 走进去的世界 — HeyAmit_ · 2026-09-23
- 一人包揽 AI 音乐 MV:作者实测全流程,称「单人制片厂」不到一年 — kraussian · 2026-09-23
- MiniMax H3 Ref2VA 实测:第 8 张参考图触发初始化卡死 — itchplease · 2026-09-23
- H3 长视频画质衰减有解:二次精修注入噪声稳住 latent — xyzdist · 2026-09-23
- 开发者用 Codex+GPT Image 2.5 自动生成角色替换 LoRA 数据集 — ostrisai · 2026-09-23