通义发布实时语音模型Qwen-Audio-3.0-Realtime
千问大模型 · wechat · 2026-07-15
阿里正式发布 Qwen-Audio-3.0-Realtime,主打“又快又聪明”的实时语音交互:既追求毫秒级响应,也尽量保留推理能力。官方同时给出 Plus 和 Flash 两个版本,分别偏向更强推理和更低延迟。
文中重点强调了四类能力升级:
- 智商/推理:在 VoiceBench、AudioMultiChallenge 等基准上表现提升,口语化输入下衰减较小。
- Agent 工具调用:无需明确指令即可自行触发外部工具,结果会进入对话记忆,可通过 FunctionCall、MCP、API、知识库接入。
- 共情表达:可根据语境调整语气、节奏、音调,并通过笑声、叹息、犹豫等副语言信号增强自然度。
- 双工交互:支持边说边听、随时打断、多人场景切换,还可通过 audioprompt 锁定声纹。
官方将其能力来源归结为 On-Policy Distillation 和多教师蒸馏:文本大模型的推理能力被蒸馏到语音模型中,同时用不同教师分别补强口语偏好、通用问答、Agent 调用和音频理解。
所属事件:阿里发布实时语音模型 Qwen-Audio-3.0-Realtime(2 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11