NVIDIA 开源全双工语音模型 VoiceChat,支持边说边听与工具调用
chaumian · x · 2026-09-22
NVIDIA NemotronLabs 团队发布论文 VoiceChat,这是一个开放的全双工(full-duplex)语音到语音模型,最大亮点是在实时语音对话中支持工具调用能力。
与传统轮流说话的语音助手不同,全双工架构允许模型同时听和说,更接近人类自然对话体验;工具调用能力则让模型在纯语音交互中也能执行外部操作(如查信息、触发动作),是迈向实用语音 Agent 的关键一步。论文作者阵容庞大,包含多位 NVIDIA 语音方向核心研究员。
所属事件:NVIDIA 发布开源全双工语音模型 VoiceChat 支持工具调用(2 条相关)→
「多模态」频道最新
- 北邮研究揭示视频扩散模型违反物理的根源:RoPE 注意力衰减锁死轨迹 — BUPT-CIST · 2026-09-22
- 腾讯 ARC 发布 WorldCrafter:隐式 3D 记忆让视频世界模型分钟级探索保持一致 — TencentARC · 2026-09-22
- Grok 4.7 在 Blender 里搞出创作,一段演示引发围观 — iamfakhrealam · 2026-09-22
- Kyutai 发布语音原生推理模型 Voice of Reason,GSM8K 达 77.1% — alexcovo_eth · 2026-09-22
- 24G 内存 MacBook 跑 Qwen-Image 本地生图:一张要 5-6 分钟 — vista8 · 2026-09-22
- 腾讯混元发布 Hy Image3.5 preview:人工评测胜率提升 30%,单图 $0.024 — TencentHunyuan · 2026-09-22