RAG 不是 LLM 时代的新发明,核心思路 2000 年代就有了

Forgotten History or Test-of-Time? Retrospect and Prospect on RAG from an IR Perspective

Xiaoyan Zhao, Yujie Cai, Yang Zhang, Grace Hui Yang, Tat-Seng Chua

cs.AI

2026-08-09

这篇综述把 RAG 的核心思路追到 LLM 之前几十年的检索问答研究,主张把 LLM 当作套在老旧 QA 架构之上的新接口层。

这篇在解决什么

业界普遍把 RAG 当成「为了弥补大模型缺陷而诞生的新范式」。这篇综述认为这个叙事不完整。RAG 的核心思路,包括检索与生成结合、知识增强、答案验证、查询迭代改写,在 LLM 出现之前的 IR(信息检索)和 QA(问答)研究里,2000 年代初就有人做、有系统落地。作者要做的是把这条被忽视的血统系统地理出来,并解释它为什么一直没被认出来。

方法

论证方式是历史溯源加系统对照。作者沿四条主线把现代 RAG/Agentic RAG 往回追:

作者特别拎出 QUALIFIER(2002 至 2003)作为「原型 Agentic RAG」:它由答案验证驱动迭代查询改写,采用 Successive Constraint Relaxation(逐步松弛约束)策略,在 TREC 2002 上排第二,500 题答对 290 题(58%),仅次于 LCC(83%),压过 IBM、MIT、USC/ISI、BBN。设计原则是「先用紧约束把精度顶上去,找不到答案再逐步松开」,这正是今天 Agentic RAG 在做的事。

结果

这是一篇立场/综述文章,没有实测实验,结论是论证性的而非数字的。它提出两点可操作的产出:

一是概念连续性框架(论文图 1):经典 QA 演化到现代 RAG(单轮检索再回答),QUALIFIER 那条迭代检索加精修的线演化到 Agentic RAG,两条线各有前身。

二是四个被前人研究覆盖、但当代 RAG 还没用透的方向(论文图 2):个性化 RAG(接入用户长期偏好建模)、主动 RAG(不止被动应答、帮用户澄清潜在需求)、治理感知 RAG(结构化护栏、访问控制、可审计)、以用户为中心的评估(抑制反馈偏差的指标)。

作者也解释了这条血统为何被忽视:IR 与 RAG 社区割裂、术语跨时代漂移、快节奏领域的近因偏差。

为什么重要

对在做 RAG 系统的人,这篇的价值是止损:它把一堆已经被前辈 QA 系统验证过、但当代又在重新发明的机制(用户建模、答案校验、查询精修)摆出来,提醒别再无意中重新发现一遍,该去 IR 老文献里借力。把 LLM 定位成「老架构之上的新接口」也是个有用的视角:它让人看清哪些是真正的新东西(生成质量),哪些是换皮的老问题(检索、验证、改写)。

局限与存疑

这是综述/立场文章,所有结论都是论证性的,没有在新数据上跑实验验证那四个方向是否真的有效,所以它的四个未来方向更像研究议程而非已证结论。作者自己也逐一承认每个方向的难点:个性化要处理稀疏噪声大的用户信号和 LLM 长上下文退化;主动 RAG 要在干预时机和打扰成本之间权衡;治理感知在生成式不确定下比传统 IR 更难落地;以用户为中心的评估要解决多阶段流水线的归因和生成输出的不一致。读者还要自己判断:把二十多年前的 QA 经验直接搬进今天的神经检索栈,中间的表征和规模差异有多大。

术语

原文与代码

社区讨论

相关论文

全部论文解读