RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored
Gregory Druck, Ethan Smith
cs.CL, cs.IR
2026-08-23
Graphite 用 1,528 次模拟、三家模型和 1,019 个问题发现:RAG 检索到自己生成的文章后,79.6% 会塌成同一套答案。一篇自写参考文献就够触发,因为它被引用的概率是原文的数倍。
模型崩溃(model collapse)说的是:用自己的输出再训练,分布会越来越尖,最后不像原始数据。Shumailov 等人 2024 年钉过这条训练回路。现在的问题换成检索。网页上 AI 文章已经和人写的一样多,带搜索的 LLM 会把这些页面读进上下文。Graphite 把这种回路叫 RAG collapse:答案不再反映网上意见的分布,十次回答变成同一套名单。
他们测过 ChatGPT 引用页:2026 年 1 月已有 38.9% 被 GPTZero 标成 AI 或混合,6 月升到 42.7%。实体类问题更高(41.1%→45.8%)。训练回路还没关,检索回路已经在转。
不重训底座,只改 RAG 上下文。每个问题先从 ChatGPT 或 Google AI Overview 抓真实引用,抽正文,每轮生成 10 条回答,再把回答扩写成「网上文章」塞回引用池。三种替换节奏:
停轮分别为 10 / 20 / 30。问题分两类:实体比较(「现在最好的 Twitch 主播是谁」)和观点/方法类编辑问题。共 1,019 个不重复问题。温度保持默认 1.0。对照实验确认:不加自写引用,只有采样噪声,不会塌。
塌的定义:实体题看十次回答里点名的实体是否完全相同;编辑题看「是否同一答案」的两两比例是否到 100%(GPT-5.2 当裁判,每轮抽 10 对)。
1,528 次模拟里 1,216 次(79.6%)以塌结束。Replace All 与 Replace One 的终点塌缩率几乎一样:GPT-5.2 Chat 实体题都是 88.12%,编辑题 91.23% 对 94.74%。Search 更像真实检索,仍有 77.23% 和 75.44%。大规模 Search(GPT-5.2)再跑 742 道实体题、102 道编辑题,终点塌缩 73.85% 和 83.33%。
塌得很快。Replace One 第 2 轮只多了一篇自写引用(约占池子 10%–20%),实体题已有 22.8% 塌掉,Replace All 同期 28.7%。一篇就做了全替换的大部分工作。同轮回答从第 1 轮不到 30% 互为转述,后期超过 90%。实体可见度会从「有的总出现、有的偶尔出现」变成全 0 或全 100,连第 1 轮 100% 出现的名字也可能被挤出去。
Gemini 3 Pro 和 Claude Sonnet 4.5 在 Replace One 上同样塌,不是 OpenAI 一家的病。Gemini 稍慢,置信区间大多重叠。
关键机制是自引用偏好,不是「AI 文风」。Replace One 第 2 轮里,原文 39.7% 已是 AI 生成,但开局只有约 3% 实体题是塌的。引用率:自写 38.9%,AI 原文 9.4%,人写原文 7.4%。把质量打分限制在「直接回答 / 组织 / 相关性」三项全 5 分的子集(75 篇自写 vs 118 篇原文),自写仍以 38.2% 对 13.3% 被引,约 2.9 倍。回归控制八维质量后,「自写」单独贡献约 26 个百分点,「原文是 AI」系数不显著。
| 设置 | 开局已塌 | 结束时塌 |
| Replace One / GPT-5.2 Chat / 实体 | 2.97% | 88.12% |
| Search / GPT-5.2 Chat / 实体 | 1.98% | 77.23% |
| Replace One / Claude 4.5 / 实体 | 1.67% | 91.67% |
| Search / GPT-5.2 / 742 实体 | 7.01% | 73.85% |
搜索增强并不能自动「忠实复述网页分布」。模型更爱自己的句式和自己会给出的答案,少量自写页就能改写可见实体名单。做 AEO / GEO 的人会关心谁活到最后;做 RAG 产品的人要担心引用池一旦混进自家模型的旧回答,多样性会塌。论文没有给出已上线的缓解方案,只是把风险写成可重复的模拟。
种子引用来自 2026 年 1 月的商业系统,其中 38.9% 已是 AI 生成,无法标出哪些本就是同一模型的自写。若种子里已有自写,对比只会更弱,作者认为结果偏保守。模拟没有继续往池子里加「别人家模型写的 AI 文」,那种回路会不会塌,没测。
这是受控模拟,不是对 ChatGPT 线上产品的审计。作者写明:不能据此断言 RAG collapse 已经在发生,现有检索或引用策略也可能在挡。覆盖面偏信息检索和实体比较,事实题(答案本来就唯一)和开放创作题怎么走,未知。每问因成本只跑一次,Twitch 例子的 9 次重复显示终局实体集合会换人,点估计带方差。Search 里更大 chunk 会塌得更快,检索器超参会改速率。