实测 265 段录音:语音隔离让开放办公区 STT 错误率 31.8%→6.3%
thetripathi58 · x · 2026-09-24
Krisp 的一项测试揭示了语音 agent 的一个核心痛点:STT 能在嘈杂环境里转录,却分不清该听谁说话。有人中途插话时,agent 会把背景同事的话混进用户指令,回复用户从没说过的话。
Krisp 在 11 种 STT 配置下测试了 265 段真实录音,对比开启/关闭语音隔离的效果:
- 开放办公区:词错率 31.8% → 6.3%
- 呼叫中心:23.9% → 6.9%
- 整体:23.3% → 6.2%
相当于开放办公区从每 3 个词错 1 个降到每 16 个词错 1 个。录音与人工标注转录已全部开源在 Hugging Face 上,可自行验证。
所属事件:语音 Agent 分不清说话人,语音隔离实测大幅降错(2 条相关)→
「编程与Agent」频道最新
- LangChain 给 Deep Agents 加调度功能:cron 表达式让 Agent 后台自主运行 — Hacubu · 2026-09-24
- GPT-6 变「懒」了?开发者实测:更像结对程序员而非自主工人 — PaulShellDev · 2026-09-24
- Pi 官方开源 pi-voice:本地语音接入 Agent 全链路不经第三方 — solyarisoftware · 2026-09-24
- DeepSeek 推出新 Agent 训练系统:可同时运行 38 万个沙盒 — Polymarket · 2026-09-24
- 用一句极简提示词:Opus 5.5 连跑 3.5 小时做出 AAA 级怪兽模拟 — majidmanzarpour · 2026-09-24
- 一句话 prompt 测创意:Opus 5.5 自主工作 3.5 小时产出纯 three.js 怪兽模拟 — majidmanzarpour · 2026-09-24