语音 Agent 会先「听」再行动吗?新基准显示原始音频模型静音率仅 14%
Yanjie Zhang · hf · 2026-10-02
Yanjie Zhang 等发布 VGBench,一个 1,018 项的诊断基准,测评音频 LLM 在旁人说话、自言自语、说话人切换场景下是否该执行动作(静音、调工具或直接回答)。语音切换对保持指定文字不变,仅改变声源、距离渲染与时间边界,实现可控的「佩戴者-旁观者」切换。结果发现六个原始音频模型和三种免训练改造往往能识别目标工具,却很少在该闭嘴时闭嘴——最高的切换静音率仅 14%。后训练案例 VoxGate 用监督训练把切换指令静音率提升到 91.3%,同时为佩戴者指令正确选工具;探索性 GRPO 阶段类似,旁话准确率从 68.4% 升至 70.9%,自言自语静音从 52.0% 升至 60.0%。因子化对照显示存在独立的声源变化效应,且对远场操纵的敏感度因声学渲染而异——基准测的是多线索声学上下文门控而非孤立的说话人识别。
「研究」频道最新
- SECRET 免训练法缓解音视频大模型跨模态幻觉,最高提升 18 个百分点 — Yu Zhang · 2026-10-02
- 美团 LongCat 提出 N-OPSD:邻近专家池自蒸馏,AIME 均值最高提升 2.75 分 — meituan-longcat · 2026-10-02
- DMM 迭代意图去噪解多智能体寻路,1600 任务解决 1598 并扩展到百万智能体 — Valeriy Vyaltsev · 2026-10-02
- ProVer 论文:让 LLM 裁判定位关键步骤,Agent RL 超 GRPO 9.9% — omarsar0 · 2026-10-02
- 哥本哈根大学招募无分词语言模型方向博士生,办公室设在植物园天文台 — delliott · 2026-10-02
- Memorizon:流式世界模型跨重访训练,长跨度只增 12% 步时成本 — MBZUAI-IFM · 2026-10-02