通义发布实时语音模型Qwen-Audio-3.0-Realtime

千问大模型 · wechat · 2026-07-15

阿里正式发布 Qwen-Audio-3.0-Realtime,主打“又快又聪明”的实时语音交互:既追求毫秒级响应,也尽量保留推理能力。官方同时给出 Plus 和 Flash 两个版本,分别偏向更强推理和更低延迟。

文中重点强调了四类能力升级:

官方将其能力来源归结为 On-Policy Distillation 和多教师蒸馏:文本大模型的推理能力被蒸馏到语音模型中,同时用不同教师分别补强口语偏好、通用问答、Agent 调用和音频理解。

所属事件:阿里发布实时语音模型 Qwen-Audio-3.0-Realtime(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →