VoxParity 语音基准:23 个语音智能体仅 11 个能听懂弦外之音
Bhavik Mangla · hf · 2026-10-01
VoxParity 基准测试语音智能体是否能根据「声音本身」改变决策,而非只依赖文字转写。基准覆盖 14 个行业的 183 个场景:文字转写完全不变,仅音频变化(求救的 mayday、医疗监护仪滴滴声、儿童声音下注、恐惧的耳语等),考察正确的工具调用是否随之改变。
核心发现:
- 能跑转写的 23 个系统中仅 11 个通过「超越只读转写流水线」的零假设检验;
- 误差系统性偏向文字:当音频要求保护时,28 个系统执行常规请求的比例(41%)远高于在干净通话上过度反应(12%);
- 领先系统的失误多落在它们「听到了」的线索上;对听到的厌世或困惑信号,领先系统推翻原决定的频率远高于急性报警;
- 在测试的模型中,「描述声音特征」和「明示规则」各能弥补部分差距,但在情绪线索上仍留有缺口。
「模型」频道最新
- Yacine 宣布退订 OpenAI,临走前疯狂烧光 astra token — yacineMTB · 2026-10-01
- 开发团队用 Tinker API 训练 Kimi K2.6,喊话期待更多小众模型 — cHHillee · 2026-10-01
- Google 向韩国大学生免费送一年 Google AI Plus 订阅 — Ashamed_Photo2123 · 2026-10-01
- Astra 6 极速模式实测:300 tokens/s 改变 agent 交互方式 — soumitrashukla9 · 2026-10-01
- Anthropic 退役 Claude Opus 3:保留 API 访问,还给它开了专栏写随笔 — repligate · 2026-10-01
- Bindu Reddy:Gemini Argon 定价 5 倍低于 Astra,跑分好看存疑 — bindureddy · 2026-10-01