Better Retrieval, Worse Robustness:How Multi-hop RAG Amplifies Upstream ASR Errors
Zhenghua Bao
EMNLP 2026 (Main Conference)
cs.CL, cs.IR, eess.AS
2026-08-24
四套口音合成语音过Whisper后,IRCoT加HippoRAG2相对干净文本的F1缺口,比朴素稠密检索大36%到67%。实体被听错占2Wiki退化案例的87%到96%。
语音助手先把话送进 ASR,再检索、再生成。口音一重,词错率上去,后面的多跳 RAG 会不会把错放大,以前没人系统测过。这篇不审公平性,只把口音当成可控的上游误差条件,看结构更复杂的检索是吸收错误,还是把缺口撑得更大。
作者用微软 Edge TTS 的四种女声(美式、印度、菲律宾、尼日利亚)合成问题,Whisper-large-v3 贪心转写,对照一条绕过语音的干净文本 oracle。三个多跳集各抽 1000 题:HotpotQA、2WikiMultiHopQA、MuSiQue。生成器固定 gpt-4o-mini。
四套检索,结构由简到繁:
「放大」比的是同一方法从 oracle 到高 WER 口音的 F1 缺口,不是绝对分数。退化案例定义为:干净输入 F1≥0.5,转写输入跌破 0.5。错误类型用 difflib 规则打标,大写多词当作实体代理。
两套表面修补当诊断探针:五个温度的 N-best 并集检索,以及 Double Metaphone 加编辑距离的语音近邻实体纠正。
每个数据集、每种方法,口音都低于 oracle,尼日利亚口音 WER 最高、缺口最大。相对降幅约 15% 到 34%。WER 与缺口的 Pearson r=0.88。
| 数据集 | Naive 缺口 | 组合方法缺口 | 相对增幅 |
| HotpotQA | 0.104(0.617→0.513) | 0.142(0.730→0.588) | +36.5% |
| 2Wiki | 0.137(0.468→0.331) | 0.195(0.645→0.450) | +42.3% |
| MuSiQue | 0.043(0.282→0.239) | 0.072(0.381→0.309) | +67.4% |
绝对 F1 仍是组合方法更高:2Wiki 尼日利亚口音上 0.450 对 Naive 的 0.331。结构换来峰值,也换来更大的干净-噪音落差。只加 IRCoT 或只加图,缺口都会变宽;两个一起最宽。IRCoT 在第 1 步甚至略微帮 Naive 收口(0.104→0.096),到第 3 步才把 HippoRAG2 撑到 0.142。
实体损坏是主因。2Wiki 上占退化案例的 87% 到 96%,HotpotQA 67% 到 82%,MuSiQue 54% 到 78%。WER≥20% 的 2Wiki 题(413 题,占尼日利亚池 41%)里,Naive 退化 25.2%,组合方法 37.8%。
N-best 几乎不补:恢复 -2.2% 到 +2.5%。语音纠正最好也只关上 11.1% 的缺口,HippoRAG2 受益最大。500 条真实尼日利亚口音 WER 28.9%,不低于合成的 17.1%。换 SeamlessM4T 后 WER 到 28.0%,方法排序不变,最大缺口从 0.195 到 0.214。
语音多跳系统如果只看干净文本榜,会选 IRCoT 加图检索。口音一来,同一套结构把实体错误写成后续查询、写进 PageRank 种子,剩下的正确词也被改写步骤丢掉。部署上更稳的折中,可能是高 ASR 置信时才开多跳,低置信时退回稠密检索。表面纠错补不了结构放大。
主实验是 TTS,每种口音一个女声,不是真人多跳录音。真实语料只用来核对 ASR 模式,没有端到端问答。语言限于英语。实体标签是规则代理,没有人工复核。生成器只有 gpt-4o-mini,IRCoT 换更大模型可能不一样。作者也说这不是公平审计,合成音不能外推到人群。