通义发布实时语音模型Qwen-Audio-3.0-Realtime

千问大模型 · wechat · 2026-07-15

阿里正式发布 **Qwen-Audio-3.0-Realtime**,主打“又快又聪明”的实时语音交互:既追求毫秒级响应,也尽量保留推理能力。官方同时给出 Plus 和 Flash 两个版本,分别偏向更强推理和更低延迟。 文中重点强调了四类能力升级: - **智商/推理**:在 VoiceBench、AudioMultiChallenge 等基准上表现提升,口语化输入下衰减较小。 - **Agent 工具调用**:无需明确指令即可自行触发外部工具,结果会进入对话记忆,可通过 FunctionCall、MCP、API、知识库接入。 - **共情表达**:可根据语境调整语气、节奏、音调,并通过笑声、叹息、犹豫等副语言信号增强自然度。 - **双工交互**:支持边说边听、随时打断、多人场景切换,还可通过 `audio_prompt` 锁定声纹。 官方将其能力来源归结为 **On-Policy Distillation** 和多教师蒸馏:文本大模型的推理能力被蒸馏到语音模型中,同时用不同教师分别补强口语偏好、通用问答、Agent 调用和音频理解。

所属事件:阿里发布实时语音模型 Qwen-Audio-3.0-Realtime(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →