AirCaps 推出音频研究实验室:噪声下语音识别 WER 高达 20%
ycombinator · x · 2026-09-03
语音创业公司 AirCaps 公开上线 AirCaps Audio Research Lab,主攻物理世界的真实声学环境。其核心判断是:现实音频远比数字世界音频难——主流语音模型在远场、混响、低信噪比、多人重叠语音场景下性能急剧下降。
关键事实:
- 引用 Ayllon et al. (2026) 研究:40 个领先 ASR 模型在带背景噪声语音上中位词错率(WER)达 20.45%,而它们在干净基准上报告仅 2-3%;
- 现有最大语音数据集与基准(如 Librispeech)与真实世界复杂度差距很大,真实噪声音频数据稀缺;
- AirCaps 构建全流式语音/音频模型:目标说话人提取、远场增强、说话人分离、说话人日志、语音转文本,宣称在最难声学环境下大幅领先主流云语音模型,并可在消费级硬件端侧运行。
团队此前有 8 年消费电子语音技术开发经验。
「模型」频道最新
- Baseten 上线 GLM-5.3 Fast:开源权重强模型提速,面向实时场景 — baseten · 2026-09-03
- 多位用户反馈 Claude 近期错误频出,幻觉问题成日常 — lilyraynyc · 2026-09-03
- 首次实测 Gemini 3.8 Flash 翻车:一直思考直到超时 — rickasaurus · 2026-09-03
- 用户反馈:fable 5 好用程度胜过 fable 5.1 — BLUECOW009 · 2026-09-03
- 用户实测 Flash 3.8:能力出色但会陷入静默死循环烧 token — brandon_galang · 2026-09-03
- 用户吐槽 Claude Max 20x 限额不清:周限额才是真瓶颈,发帖被删 — conorearly · 2026-09-03