RING: Retrieval-Internalized Generation for Continual Large-Scale Knowledge Injection
Shicheng Xu, Liang Pang, Liyi Chen, Zihao Wei, Jingcheng Deng, Yan Gao, Yi Wu, Yao Hu, Huawei Shen, Xueqi Cheng
cs.CL, cs.AI
2026-08-03
RING用记忆混合专家加强化学习把检索学进模型权重,在post-cutoff新闻基准News-2025上超过最强参数注入基线SR-KI 3.2分,推理比RAG快3~19倍。
检索增强生成(RAG)靠外部检索器保证事实性,但也带来推理延迟和工程负担,每次问答都要先查向量库、再拼上下文、再让 LLM 生成。想把这套流程完全去掉,把外部知识直接塞进模型参数里(parametric injection)不是新想法,但已有方法各有硬伤:知识编辑一次只能改几条孤立事实;持续预训练容易遗忘旧知识;把知识挂进模型计算流的模块化注入方法(比如 KBLAM)存储量随语料线性增长;参数化 RAG 虽然把文档参数化了,推理时却还得靠外部检索器去定位该激活哪部分参数。这些方法有一个共同的隐藏假设:检索机制本身可以是固定的、规则设计的,只有「记忆」需要学习。RING 反过来问:检索本身能不能也是学出来的?
RING 把一个稠密 LLM 的 MLP 层替换成稀疏的「记忆混合专家」(Mixture-of-Memory Experts):一个 Basic Expert 保留原始权重防止遗忘,一个 Knowledge Expert 承担新语料的参数化记忆,一个可学习的路由器逐 token 决定走哪个专家。训练分三阶段。第一阶段持续预训练,把新语料塞进 Knowledge Expert,这里用到论文提出的 Dual Causal Attention(DCA):普通因果预训练每个 token 只能看到它之前的内容,DCA 额外用双向视角处理一部分目标片段,让模型在存储阶段能利用更完整的上下文,同时推理时仍然保持严格自回归。第二阶段监督微调,教模型学会「先检索、再回答」的单次生成模式:模型先在 <retrieval> 标签里吐出一段它认为相关的记忆片段,再在 <answer> 标签里给出最终答案。第三阶段强化学习(用 GSPO 算法),用格式对不对、检索到的片段和标准证据的最长公共子串有多长、最终答案对不对这三类奖励,训练路由器和 Knowledge Expert 学会精准检索。整个过程不依赖任何外部向量库,推理时模型完全靠参数内部生成检索结果。
论文专门构建了 News-2025 基准,17 万篇发生在基座模型预训练截止日期之后的中英文新闻,确保正确答案不可能来自模型预训练时记住的知识或推理蒙对。在 Qwen3-8B 骨干上,RING 达到英文 35.08%、中文 32.36% 的准确率,比此前最强的参数化注入基线 SR-KI 高 3.23 和 3.14 个百分点,全面超过 KBLAM、LoRA/全量微调、LAG、MLP Memory、AtlasKV 等所有对比方法。换成 Qwen3-14B 骨干,优势进一步扩大到至少 3.5 个百分点。跟外部检索式 RAG 比,RING 站在了准确率-延迟的帕累托前沿上:8B 骨干下最强的 RAG 流水线(检索 top-10 再用 Qwen3-Reranker 精排到 top-3)中文准确率比 RING 高 8.69 分,但首 token 延迟(TTFT)是 RING 的 10 倍;换成 14B 骨干,RING 反过来在英文上超过这条最强 RAG 流水线,中文差距缩到 2 分以内,同时速度还快 6 倍。整体上 RING 比各种 RAG 配置快 319 倍,延迟水平和「不做任何检索计算」的全量微调基线相当。消融显示三处设计都有实打实的贡献:稀疏 MoE 架构比稠密基线提升 2 分左右,加上门控路由再提 2.4 分;DCA 比标准单向因果注意力高 1.6 分;检索奖励比只用答案奖励高近 3 分。
对需要频繁做知识问答、又对推理延迟敏感的场景(客服、搜索建议这类高 QPS 服务),RING 提供的是一条把 RAG 的准确率优势尽量保留、同时去掉外部检索基础设施的路径:不用维护向量库,也不用担心检索器和生成模型不匹配。论文也给出了一个理论视角:把 RING 形式化成经典 RAG 目标的一个判别式潜变量近似,路由器加 Knowledge Expert 在理论上可以逼近显式 top-K 检索的表达能力,这为「参数化检索能不能追上外部检索」这个问题提供了一个不算空洞的论证框架。
论文自己承认的最大限制是:RING 假设知识语料相对稳定,能在部署前离线注入;真要更新知识,必须重新训练,这和外部 RAG 随时增删文档的灵活性没法比,对高频变化的知识源不友好。第二,<retrieval> 标签里生成的内容不是原文的逐字返回,模型可能压缩、改写甚至扭曲记住的内容,这对需要精确引用溯源的场景(比如法律、合规)是个实打实的问题,论文建议这类场景仍需要外部校验兜底。第三,论文的实验场景是知识密集型问答,没有覆盖多跳网页搜索、快速变化的事实、多语言知识库或需要引用大量来源的长文生成,RING 能不能扩展到这些场景还是未知数。