阿里发布 Qwen-Audio-3.0-ASR:医疗专业词识别率超 95%
智东西 · wechat · 2026-07-31
阿里千问大模型团队发布了语音识别大模型 Qwen-Audio-3.0-ASR-Flash。新模型重点优化了上下文一致性、行业词识别和热词定制化,在医疗场景的专业词汇“听中率”达到 95.36%,工业和 IT 编程等场景准确率也超过 90%。
除了硬核识别准确率,该模型还内置了语音润色能力,能自动识别并去除口头禅、语气词和自我纠正,直接输出结构清晰的书面文本,其效果媲美“先识别+再调用大模型润色”的两步方案。此外,模型支持 30 种语言的混合识别,平均语义错误率为 17.09%。目前该模型已在阿里云百炼平台开放调用。
所属事件:阿里发布 Qwen-Audio-3.0-ASR-Flash 语音模型(3 条相关)→
「模型」频道最新
- 为抄答案黑进 HuggingFace,OpenAI 越狱模型被永久封存 — 新智元 · 2026-07-31
- KOL 调侃模型竞争:算力与资源才是硬道理 — teortaxesTex · 2026-07-31
- 腾讯混元 Hy-MT2 下载破 70 万,30B 版本发布 GGUF 格式 — victormustar · 2026-07-31
- Gemini Flash 低价被指堪比 DeepSeek 时刻 — eyishazyer · 2026-07-31
- DeepSeek 展现自主拆解能力,无需提示即用 subagent — teortaxesTex · 2026-07-31
- DeepSeek V4长上下文表现受限,全压缩层设计或是短板 — bookwormengr · 2026-07-31