NVIDIA 新论文:语音 agent 工具调用外包给文本 LLM,召回率超 92%
omarsar0 · x · 2026-09-20
NVIDIA 最新研究给全双工语音模型加上了工具调用能力,指出语音 agent 的短板主要在语音管线而非智能本身:
- 商业双工语音模型在干净环境下仅能完成 31-51% 的真实客服任务,而 GPT-5 等文本 agent 在同类任务文本模式下可达 85%。
- 修复思路:把决策从语音模型中外包——双工前端学习发出「委派 token」,将流式转写转发给文本后端 LLM 执行工具调用,再通过轻量的 prefill-and-repeat 机制将结果送回流式 TTS 播报。
- 效果:工具调用召回率达 92.0-97.2%,对无关调用的拒绝准确率 81.2%,同时轮次切换率、流式 ASR 词错率和口语智能均保持在原有水平。
「研究」频道最新
- Sandberg 引旧文:AI 正改变实验自动化风险链条的性质 — anderssandberg · 2026-09-20
- Da7em Bench 发布:每模型 200 个真实客户任务、12 领域评 AI 实战力 — airesearch12 · 2026-09-20
- 研究者质疑Laya夸大成果:2025工作并非Jev式通用系统 — Paimaamu · 2026-09-20
- 8 个分类数据集实测:有标注数据时传统 ML 仍胜过 Jev 零样本 — Ok_Juggernaut2187 · 2026-09-20
- Claude 优化 30+ 开源生物分子模型平均提速 4 倍,全部代码开源 — FinanceYF5 · 2026-09-20
- 开发者将目标跟踪结果结合 GNSS/IMU 轨迹可视化到开源街景地图 — rsasaki0109 · 2026-09-20