AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing
Xinke Jiang, Yue Fang, Zhibang Yang, Jiaran Gao, Zhixin Zhang, Tao Feng, Rihong Qiu, Wentao Zhang, Hongxin Ding, Ruizhe Zhang, Yongxin Xu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang
cs.MA, cs.AI
2026-08-30
北京大学提出带栈记忆的Agentic RAG,动作用过程奖励监督,训练时用信息量过滤轨迹。Qwen2.5-3B在HotpotQA上F1达到44.00,比最强基线Search-R1高出6.76点。
检索增强生成(RAG)能补事实,但多跳问题要求模型边想边搜,还得改写中间结论。现有强化学习版 Agentic RAG 通常只暴露 <think> 和 <search> 两类粗动作,记忆只能往后续写,奖励只看最终对错。噪声检索和错误推理一旦进上下文就擦不掉,策略会被短轨迹、高即时奖励的模板带跑偏。
北京大学这条线把问题拆成两件:动作太粗、学的轨迹太水。AgenticRag-R1 用栈式记忆加上按动作打的过程奖励,再用信息量过滤 rollout,逼模型去练长程检索和纠错。
智能体的工作记忆是一个后进先出栈,每条是一次可解释的动作。六类动作分工清楚:
奖励拆成结果和过程。结果奖励按最终答案的 Exact Match 或 F1,摊到未屏蔽的生成 token 上;检索到的观察被 mask,不回传梯度。过程奖励打在动作 token 上,包括格式分(结论 1.0、其他合法动作 0.5)、检索相关性(通用奖励模型打 0 到 1)、记忆操作是否有用(同一套奖励模型看当前栈)。过程分设预算,超额按比例缩放,防止靠狂刷动作刷分。
训练时每个问题采 K 条轨迹,在整个 mini-batch 上打分 \(\tilde r = \sigma^2 \cdot r + \mu\),只留分数最高的一段比例。方差大说明同一题走出了不同路径,奖励高说明这条路走得像样,两者相乘用来抬高「又难又多样」的样本。
训练数据来自 HotpotQA 和 2Wiki 的多跳子集,滤掉不用检索或一搜就中的题。评测用 Wikipedia 2023-11-01 转储,骨干是 Qwen2.5 的 1.5B / 3B / 7B。主指标是 F1。
| 骨干 | 方法 | 2Wiki | HotpotQA | 平均 |
| 3B | Search-R1 | 29.90 | 37.24 | 30.16 |
| 3B | AgenticRag-R1 | 32.92 | 44.00 | 33.55 |
| 7B | Search-R1 | 35.03 | 38.89 | — |
| 7B | AgenticRag-R1 | 38.34 | 45.15 | 36.60 |
3B 上 HotpotQA 相对最强基线绝对提升 6.76,七项平均提升 3.39。7B 在 Bamboogle 上到 49.21,比最强 Agentic 基线高约 7.2;同一设置下 Natural Questions 掉到 23.60,低于 Search-R1 的 29.59,单跳开域题并没有被带着走。
去掉记忆动作,3B 平均从 33.55 掉到 27.37;去掉轨迹拒绝掉到 25.43;检索奖励和记忆奖励都拿掉,平均只剩 19.94。步数上限从 10 加到 30 时,TriviaQA 上该模型从 37.53 升到 55.28,Search-R1 同期从 34.21 滑到 32.28。冷启动 RL 平均 33.55,SFT 初始化后再 RL 到 35.20,纯 SFT 只有 22.40。
对要训检索 Agent 的人,这篇把「可回退的记忆」写成一等动作,而不只是把检索日志拼进 prompt。过程奖励加预算,是在对抗「多搜多想就能刷分」。信息量拒绝则承认一个脏事实:多数多跳题其实很浅,不筛的话强化学习会躺在短轨迹上。
代价也很具体。栈和动态检索更贵;拒绝阈值要调,论文里 F1 在 0.6 到 0.8 一段较好。7B 在 NQ 上的回退说明,长程设计不会自动变成更好的单跳 RAG。能复用的是动作设计和过滤逻辑,不是这个匿名仓库里的现成权重。
作者自己写了计算开销和拒绝采样超参敏感。Bamboogle 的长程曲线并不单调:10 步 10.03,20 步 14.29,30 步才 35.47,和「步数越多越稳」的叙述对不上。7B 的 NQ 掉点没有单独诊断。过程奖励依赖外部通用奖励模型,这篇没有报告该模型的偏差会如何渗进策略。训练过滤了「太简单」的题,评测集里仍有单跳题,分布是错开的。