Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA
Jingjie Ning, Xueqi Li
cs.IR, cs.CL
2026-08-24
固定模型扩 FineWeb 索引,CMU 用重复调用扣掉生成噪声。NQ 上语义超额 churn 10.25 个百分点,精确匹配只变 −1.50 点;40/400 题发生稳定语义翻转。
检索增强问答换一批语料、扩一次索引,模型名、提示、检索策略和生成控件都可以不变,答案却换了。平均准确率会把对的和错的抵消掉;生成本身也有随机性,单次前后对比会把噪声算成更新效应。CMU 这篇把这种被准确率看漏的现象叫 accuracy-blind answer churn,并给出一套扣掉同快照重复分歧之后的审计。
Snapshot Compatibility Audit 在每个问题上、每个语料快照上各采两次独立回答。组内两次的平均一致率减去跨快照四对的平均一致率,得到 excess answer churn D̂。D̂>0 表示跨快照比同快照更爱改口。两个主核:归一化精确匹配,以及盲评语义等价(看不到尺度、证据和对错)。验证集是预注册的 400 道 Natural Questions,把 FineWeb 可访问前缀从 1 个 shard 扩到 7 个,其余接口锁死;另有预注册的 200 道 TriviaQA。证据在生成前锁定,重复测量的是生成器噪声。语义裁判先给每题 8 个匿名答案打完全 28 对,再解锁金标。决策门要求精确 D̂≥3 个百分点,且精确和语义的单侧 95% 下界都为正。
NQ 上归一化精确 D̂=6.44 个百分点(下界 4.56),语义 D̂=10.25(下界 7.69),精确匹配准确率只变 −1.50 点。TriviaQA 方向一致、幅度更小:3.00 和 2.125 点,EM 反而 +1.25。事后严格稳定翻转(两端组内语义一致、跨快照全部不一致)有 40/400 道 NQ,贡献了 10.25 里的 10.00。800 次 NQ 配对里,46 次从 EM 命中变成未命中、34 次反向,净变化只有 −1.50 点,但毛正确性流动已是 10%;另有 19.38% 在两个都未命中的不同答案之间切换,准确率完全看不见。端点 top-8 文档平均只重叠 1.19/8。换 DeepSeek V4-Pro 的 100 题子集里语义超额 churn 仍有 8.75 点,EM 却 +3.00。跨家族裁判与原裁判在 1400 对上一致率 95.71%。
| 研究 | 语义超额 churn | 端点 EM 变化 |
| NQ 400(V4-Flash) | 10.25 pp | −1.50 pp |
| TriviaQA 200 | 2.125 pp | +1.25 pp |
| NQ 100(V4-Pro) | 8.75 pp | +3.00 pp |
索引重建可以是一次行为发布,即使权重和对外 API 没变。缓存、回归测试、下游工作流会吃到换答案,仪表盘上的 EM 还可以是绿的。发布检索增强系统时,应当把超额答案 churn 和效用一起报。方法本身不贵:每题每状态两次独立调用,再加一次盲语义比较。作者的建议停留在审计,没有给出该不该拦发布的通用阈值。
干预是一条冻住的 FineWeb 嵌套路径,shard 顺序和内容混在一起,推不出「语料越多 churn 越大」的定律。主生成器是 DeepSeek 一家、一种检索服务、英文开放域问答。无检索的闭卷 EM 在各尺度都更高,这篇并不证明扩语料有用。语义裁判没有人类金标,50 题跨家族审计不能代替。每状态两次重复是能估组内噪声的下限,对条件输出分布仍然很粗。单轮检索生成器的结论不能外推到多步智能体轨迹。