通义千问发布Qwen-Audio-3.0-ASR,支持长音频上下文与30种语言

千问大模型 · wechat · 2026-07-31

阿里通义千问正式发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点解决专业词汇识别与长音频连贯性问题。该模型曾在 ArtificialAnalysis 评测中以 1.7% 的错字率位列全球第一。

新模型主要带来四大升级:

此外,面向低延迟场景的 Streaming 版本在保持 300ms 出字延迟的同时,将复杂工业场景的中文错字率降至 7.8%。目前系列模型已在阿里云百炼平台开放调用。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →