实测:房间混响与低信噪比对 STT 的伤害远超模型大小

ChromaForge · reddit · 2026-07-30

在语音转文字(STT)任务中,当转录失败时,人们往往归咎于模型不够大,而忽略了物理音频输入的质量。

作者通过声学测试发现,房间混响(导致梳状滤波器效应)和低频环境噪音(抬高本底噪声)会严重破坏高频能量,导致模型解码错误。实验表明,相比于将 Whisper-medium 升级到 Large-v3,在将音频输入模型前进行自适应谱减法和前端 DSP 滤波来提升信噪比(SNR),能带来更显著的词错率(WER)降低。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →