Hume用三类探针量化ASR刷榜:最高分模型照抄错误标注

Towards Quantifying Benchmark Optimization in ASR Models

Theo Lebryk, David Ayllon, Alice Baird, Jakub Piotr Cłapa, Jens Madsen, Panagiotis Tzirakis

cs.SD, cs.AI

2026-08-20

Hume用三类探针测11个开源ASR。VoxPopuli上WER最低的6个模型,音频与标注冲突时仍复述错误参考,accept-ref达0.18–0.30;窄声学线索可触发,线性转向可关掉。

这篇在解决什么

公开 ASR 基准的 WER 已经喊了近十年接近人类水平,真实场景里的识别质量一直对不上。行业通常把这个缺口当成覆盖问题:基准没覆盖的声学条件,加新基准就行。Hume AI 指出还有一层测量问题。模型可以学会基准特有的声学捷径,把报告分数刷下去,听写能力却没有变强。

他们把这种行为叫 benchmark optimization,口语里就是 benchmaxxing:分数提升来自吃基准伪影,不是可泛化的转写能力。

方法

核心设计是找「音频并不能唯一支撑参考文本」的位置,看模型会不会硬贴参考。三个探针:

他们还定义了 audio lift:相对把波形置零的语言模型先验,音频把参考片段的对数似然抬高了多少(按字符数归一化)。正值表示抬升来自音频。

机制侧用截断、拼接、TTS 克隆、激活修补和线性转向,定位这套策略何时被触发、写在编码器还是解码器里。评了 11 个开源模型,覆盖 encoder–decoder(Whisper-Large-v3、Cohere-Transcribe、Parakeet-TDT 等)和 speech-LLM(Canary-Qwen-2.5B、Phi-4-Multimodal、Higgs-Audio-v3 等)。主战场是 VoxPopuli 英文,并延伸到 LibriSpeech。对照用私有对话集 DaiKon、2026 年新采的欧洲议会音频 ep-fresh,以及截止日后的 LibriVox 新朗读者 libri-fresh。

结果

VoxPopuli 上 WER 最低的 6 个模型(5.4–5.8%)恰好是 accept-ref 最高的一批(0.18–0.30);WER 在 6.5% 及以上的模型全部落在 0.10 或以下。人工清洗标注上这个排序几乎不变,Cohere-Transcribe 的 accept-ref 从共识的 0.30 升到 0.52。公开基准上头部模型的掩蔽数字恢复大约能到 0.40,高于 ep-fresh 和 libri-fresh。敬称切换上 11 个模型里有 6 个显著超过 0.5;古旧分词 anyone / any one 上有 8 个超过 0.5。

模型共识 accept-ref人工标注 accept-ref
Cohere-Transcribe0.300.52
Canary-Qwen-2.5B0.230.41
Granite-Speech-4.1-2B0.210.42
Whisper-Large-v30.020.08

触发很窄。测试集说话人的 TTS 克隆能复现类似 accept-ref;同样句子换成通用音色就掉下来。截断到编辑附近的短窗,若干模型的 accept-ref 塌到地板。在真实基准片段末尾接 8 秒对话音频,Cohere、Canary-Qwen、Phi-4、Parakeet、Higgs 的 accept-ref 会塌;接一段 VoxPopuli donor 则几乎不动。反过来,给低 accept-ref 的 ep-fresh 克隆接 VoxPopuli donor,Phi-4 +0.10、Canary +0.09、Higgs +0.07、Cohere +0.07、Parakeet +0.04。

线性转向能双向拨这套策略。从拼接对上学到的差均值方向加到通用音色上,Cohere 的 accept-ref 从 0.02 升到 0.07,Canary 从 0.01 升到 0.11;把同一方向从编码器一层投影掉,Cohere、Canary、Parakeet 的 accept-ref 下降 82–92%。前三个模型 k=1 就能恢复完整方向 65–80% 的效果。激活修补显示:参考插入多半写在编码器里,漏词和替换更常被解码器策略盖掉。VoxPopuli 系统漏掉开场的「thank you, Mr President」,高 accept-ref 模型在完整片段上复述这个遗漏(输出里 courtesy 出现率为 0),截断到开场又能听出来。

Hugging Face 版 VoxPopuli 测试集有 40% 说话人漏进训练集,但高 accept-ref 模型在泄漏说话人上是 0.22、未泄漏是 0.26,说话人重叠解释不了这个现象。公开训练配方里,高 accept-ref 模型(Phi-4、Cohere、Granite、Canary)训练数据多在 100 万小时以下;Qwen3 用了 4000 万小时弱监督数据,这类行为少得多。

为什么重要

给从业者的直接含义是:只看公开 WER 会选错模型。VoxPopuli 参考错误多到任何低于 3% WER 的模型都必须去抄标注错误。这套探针可以当训练中的体检,不必等上线才发现模型在吃基准。对基准建设,i.i.d. 测试切分不够,至少要按时间或说话人分层;更干净的做法是把主榜放到非公开集。对语音 LLM 上的 RL,这些窄声学线索是潜在的 reward hacking 入口。

这不是「模型听不见」。模型学会了在基准声学指纹上切换策略。泛化能力未必被毁掉,公开分数却被抬高了。

局限与存疑

作者自己承认,他们测的是推理时行为,还不知道这套策略是训练泄漏、模型选择算法,还是记忆堆出来的。不是所有高分模型都能被线性转向:Phi-4 投影掉方向后 accept-ref 几乎不动(0.19 到 0.20)。共识面板本身包含被测模型,leave-one-out 能缓解但不能完全去掉选择偏置。主结论高度依赖 VoxPopuli 这条错误率高的基准,LibriSpeech 上的证据更偏拼写惯例,不是标注错误。DaiKon 是私有集,外人无法直接复现那一组对照。论文也没有给出 accept-ref 把公开 WER 抬高了几个绝对点,刷榜的分数水分仍是间接推断。

术语

原文与代码

相关论文

全部论文解读