通义发布实时语音模型Qwen-Audio-3.0-Realtime
千问大模型 · wechat · 2026-07-15
阿里正式发布 **Qwen-Audio-3.0-Realtime**,主打“又快又聪明”的实时语音交互:既追求毫秒级响应,也尽量保留推理能力。官方同时给出 Plus 和 Flash 两个版本,分别偏向更强推理和更低延迟。 文中重点强调了四类能力升级: - **智商/推理**:在 VoiceBench、AudioMultiChallenge 等基准上表现提升,口语化输入下衰减较小。 - **Agent 工具调用**:无需明确指令即可自行触发外部工具,结果会进入对话记忆,可通过 FunctionCall、MCP、API、知识库接入。 - **共情表达**:可根据语境调整语气、节奏、音调,并通过笑声、叹息、犹豫等副语言信号增强自然度。 - **双工交互**:支持边说边听、随时打断、多人场景切换,还可通过 `audio_prompt` 锁定声纹。 官方将其能力来源归结为 **On-Policy Distillation** 和多教师蒸馏:文本大模型的推理能力被蒸馏到语音模型中,同时用不同教师分别补强口语偏好、通用问答、Agent 调用和音频理解。
所属事件:阿里发布实时语音模型 Qwen-Audio-3.0-Realtime(2 条相关)→
「编程与Agent」频道最新
- DavidAU 协作版据称提升了 Qwen 3.6 27B 的长上下文 Agent 表现 — My_Unbiased_Opinion · 2026-07-21
- 开发者问:20 美元预算下,Claude、Cursor 还是 GPT 最适合做网站 — Upset-Farm-7380 · 2026-07-21
- Claude 长任务报错后通常还能救回已完成进度 — doodlestein · 2026-07-21
- Unity 推出终端原生 CLI,继续免费支持 MCP — jasonkneen · 2026-07-21
- 模型外层 harness 可能决定一半体感 — max_paperclips · 2026-07-21
- 清程极智发布 Agent 时代的全链路 Token 底座 — 新智元 · 2026-07-21