实测:房间混响与低信噪比对 STT 的伤害远超模型大小
ChromaForge · reddit · 2026-07-30
在语音转文字(STT)任务中,当转录失败时,人们往往归咎于模型不够大,而忽略了物理音频输入的质量。
作者通过声学测试发现,房间混响(导致梳状滤波器效应)和低频环境噪音(抬高本底噪声)会严重破坏高频能量,导致模型解码错误。实验表明,相比于将 Whisper-medium 升级到 Large-v3,在将音频输入模型前进行自适应谱减法和前端 DSP 滤波来提升信噪比(SNR),能带来更显著的词错率(WER)降低。
「研究」频道最新
- AI研究员批评同行评审沦为营销工具,呼吁重视可复现性 — evijit · 2026-07-30
- 清华提出大模型记忆架构新分类法 — THU-KEG · 2026-07-30
- 利用次优数据训练机器人,Ambient Diffusion 获双奖 — giannis_daras · 2026-07-30
- Meta 资助推出视网膜与脑成像 AI 医疗研究项目 — JeanRemiKing · 2026-07-30
- 数字大脑项目获 1500 万美元资助,构建人脑开源模型 — JeanRemiKing · 2026-07-30
- KDD 2026 论文预览:多工具长文分析中 LLM 的失败模式 — 0xsachi · 2026-07-30