通义千问发布Qwen-Audio-3.0-ASR,支持长音频上下文与30种语言
千问大模型 · wechat · 2026-07-31
阿里通义千问正式发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点解决专业词汇识别与长音频连贯性问题。该模型曾在 ArtificialAnalysis 评测中以 1.7% 的错字率位列全球第一。
新模型主要带来四大升级:
- 长上下文记忆:在识别长音频时能参考前文已识别内容,自动更新记忆,大幅降低同音词和专业术语的误判。
- 行业词与热词定制:内置多行业高质量词库(医疗场景听中率突破 95.36%),并支持即时热词配置,多数场景命中率超 99% 且无误触发。
- 一步语音润色:在识别阶段直接去除口头禅、清理口吃重复并处理自我纠正,输出结构化书面文本,效果媲美“识别+大模型润色”的两步方案。
- 多语种集成:单一模型支持中文、日韩、东南亚及欧洲等 30 种语言,七语种平均语义错误率仅 17.09%,优于 Azure 和 Gemini 3.0 Flash。
此外,面向低延迟场景的 Streaming 版本在保持 300ms 出字延迟的同时,将复杂工业场景的中文错字率降至 7.8%。目前系列模型已在阿里云百炼平台开放调用。
「模型」频道最新
- 谷歌回应AI造假质疑:Gemini生成图像已全面嵌入SynthID水印 — henkvaness · 2026-07-31
- 用户实测发现 o1-pro 变更慢更聪明 — teortaxesTex · 2026-07-31
- DeepSeek V4或可继续预训练,MOPD实现专家复用 — teortaxesTex · 2026-07-31
- MiniMax H3 视频模型上线竞技场,即将开放权重 — arena · 2026-07-31
- 2bit量化版Qwen 35B通过Terminal-Bench智能体编码实测 — DavidBennett__ · 2026-07-31
- OpenAI GPT-5.6降价80%,推理成本一年降2000倍 — Latent Space · 2026-07-31