语音 Agent 会先「听」再行动吗?新基准显示原始音频模型静音率仅 14%

Yanjie Zhang · hf · 2026-10-02

Yanjie Zhang 等发布 VGBench,一个 1,018 项的诊断基准,测评音频 LLM 在旁人说话、自言自语、说话人切换场景下是否该执行动作(静音、调工具或直接回答)。语音切换对保持指定文字不变,仅改变声源、距离渲染与时间边界,实现可控的「佩戴者-旁观者」切换。结果发现六个原始音频模型和三种免训练改造往往能识别目标工具,却很少在该闭嘴时闭嘴——最高的切换静音率仅 14%。后训练案例 VoxGate 用监督训练把切换指令静音率提升到 91.3%,同时为佩戴者指令正确选工具;探索性 GRPO 阶段类似,旁话准确率从 68.4% 升至 70.9%,自言自语静音从 52.0% 升至 60.0%。因子化对照显示存在独立的声源变化效应,且对远场操纵的敏感度因声学渲染而异——基准测的是多线索声学上下文门控而非孤立的说话人识别。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →