多跳RAG把口音ASR误差放大36%到67%,实体一错就崩

Better Retrieval, Worse Robustness:How Multi-hop RAG Amplifies Upstream ASR Errors

Zhenghua Bao

EMNLP 2026 (Main Conference)

cs.CL, cs.IR, eess.AS

2026-08-24

四套口音合成语音过Whisper后,IRCoT加HippoRAG2相对干净文本的F1缺口,比朴素稠密检索大36%到67%。实体被听错占2Wiki退化案例的87%到96%。

这篇在解决什么

语音助手先把话送进 ASR,再检索、再生成。口音一重,词错率上去,后面的多跳 RAG 会不会把错放大,以前没人系统测过。这篇不审公平性,只把口音当成可控的上游误差条件,看结构更复杂的检索是吸收错误,还是把缺口撑得更大。

作者用微软 Edge TTS 的四种女声(美式、印度、菲律宾、尼日利亚)合成问题,Whisper-large-v3 贪心转写,对照一条绕过语音的干净文本 oracle。三个多跳集各抽 1000 题:HotpotQA、2WikiMultiHopQA、MuSiQue。生成器固定 gpt-4o-mini。

方法

四套检索,结构由简到繁:

「放大」比的是同一方法从 oracle 到高 WER 口音的 F1 缺口,不是绝对分数。退化案例定义为:干净输入 F1≥0.5,转写输入跌破 0.5。错误类型用 difflib 规则打标,大写多词当作实体代理。

两套表面修补当诊断探针:五个温度的 N-best 并集检索,以及 Double Metaphone 加编辑距离的语音近邻实体纠正。

结果

每个数据集、每种方法,口音都低于 oracle,尼日利亚口音 WER 最高、缺口最大。相对降幅约 15% 到 34%。WER 与缺口的 Pearson r=0.88。

数据集Naive 缺口组合方法缺口相对增幅
HotpotQA0.104(0.617→0.513)0.142(0.730→0.588)+36.5%
2Wiki0.137(0.468→0.331)0.195(0.645→0.450)+42.3%
MuSiQue0.043(0.282→0.239)0.072(0.381→0.309)+67.4%

绝对 F1 仍是组合方法更高:2Wiki 尼日利亚口音上 0.450 对 Naive 的 0.331。结构换来峰值,也换来更大的干净-噪音落差。只加 IRCoT 或只加图,缺口都会变宽;两个一起最宽。IRCoT 在第 1 步甚至略微帮 Naive 收口(0.104→0.096),到第 3 步才把 HippoRAG2 撑到 0.142。

实体损坏是主因。2Wiki 上占退化案例的 87% 到 96%,HotpotQA 67% 到 82%,MuSiQue 54% 到 78%。WER≥20% 的 2Wiki 题(413 题,占尼日利亚池 41%)里,Naive 退化 25.2%,组合方法 37.8%。

N-best 几乎不补:恢复 -2.2% 到 +2.5%。语音纠正最好也只关上 11.1% 的缺口,HippoRAG2 受益最大。500 条真实尼日利亚口音 WER 28.9%,不低于合成的 17.1%。换 SeamlessM4T 后 WER 到 28.0%,方法排序不变,最大缺口从 0.195 到 0.214。

为什么重要

语音多跳系统如果只看干净文本榜,会选 IRCoT 加图检索。口音一来,同一套结构把实体错误写成后续查询、写进 PageRank 种子,剩下的正确词也被改写步骤丢掉。部署上更稳的折中,可能是高 ASR 置信时才开多跳,低置信时退回稠密检索。表面纠错补不了结构放大。

局限与存疑

主实验是 TTS,每种口音一个女声,不是真人多跳录音。真实语料只用来核对 ASR 模式,没有端到端问答。语言限于英语。实体标签是规则代理,没有人工复核。生成器只有 gpt-4o-mini,IRCoT 换更大模型可能不一样。作者也说这不是公平审计,合成音不能外推到人群。

术语

原文与代码

相关论文

全部论文解读