PRO-Step: Step-level Process Reward Optimization for Retrieval-Augmented Generation
MinKeon Kim, Namjun Lee, Jaekwang Kim
EMNLP 2026
cs.CL, cs.AI
2026-08-31
生成式PRM同时检查逻辑与证据,再用树搜索挖步骤偏好对做DPO。Qwen2.5-7B在五套问答上平均EM/F1为34.5/44.1,超过Search-R1的32.0/40.7和StepSearch的33.2/42.0,训练只用5000道种子题。
多跳 RAG 把检索和推理缠在一起。前面查错一次,后面整条链都会歪。Search-R1 这类方法只用最终答案对不对当奖励,中间检索废了也没人罚;信号还稀疏,往往要很大数据量才收敛。
已有过程奖励也没有真正评步骤本身。它们仍拿最终 F1 给每一步打分,检索错了但蒙对答案的轨迹会被当成正例。RAG 的步骤既要逻辑通,也要能在检索到的文档里找到依据。数学 PRM 只做前一件事。
PRO-Step 分两段。先采轨迹、再训生成式 PRM,然后用这支 PRM 做价值树搜索,构造步骤级偏好对,最后用 DPO 训策略。
轨迹是多轮交错:模型在 think 块里推理,需要事实就发 search,系统去搜,把 documents 块追加回去,直到给出 answer。从 HotpotQA 和 MuSiQue 的 2000 道题各采 16 条轨迹,去掉不完整的,留下 31728 条。QwQ-32B 给每一步写理由并打 0/1。RAG 里后面可以靠改写查询挽回,所以错步之后的步骤仍保留,不整段作废。
生成式 PRM 从 DeepSeek-R1-Distill-8B 初始化,先写理由再出对错。策略优化里,树节点的价值直接用 PRM 的二元预测乘上深度折扣,终端节点用折扣 F1。兄弟节点按回传质量加 PRM 分排序,分差超过阈值就组成 chosen/rejected。DPO 只在步骤上算损失,documents 块掩掉,避免模型背检索原文。
主实验骨干是 Qwen2.5-7B-Instruct,检索用 2018 维基 590 万篇、BGE-base-en-v1.5、k=3。策略训练混了 5000 道多跳题:HotpotQA 与 MuSiQue 各 2000,2WikiMultiHopQA 1000。
五套问答上平均 EM/F1 最高。
| 方法 | 平均 EM | 平均 F1 |
| Standard RAG | 23.8 | 31.6 |
| Search-R1 | 32.0 | 40.7 |
| ReasonRAG | 32.6 | 41.0 |
| StepSearch | 33.2 | 42.0 |
| PRO-Step | 34.5 | 44.1 |
对 Search-R1 平均高 2.5 EM、3.4 F1;2WikiMultiHopQA 上高 9.2 EM、8.9 F1。Search-R1 报告约 17 万训练实例,PRO-Step 只用 5 千种子题。去掉 PRM、只留深度折扣 F1 来组对,平均掉到 32.7 EM / 41.9 F1。同数据上 DPO 强于 SFT 和 KTO,KTO 平均只有 28.0 EM。
用 128 条候选做加权多数投票,这支 RAG-PRM 在 2Wiki/HotpotQA/PopQA 上分别到 46.5 / 59.5 / 50.8 F1,超过多数投票和 VersaPRM、MathPRM。后两个随候选变多,BoN 会选中「听起来对、证据没有」的轨迹。Llama-3.1-8B-Instruct 从 5.08/13.08 升到 16.16/22.57;3B 上对 Search-R1 从 26.22/33.51 升到 31.04/40.00。
给 agentic RAG 的过程监督补上「证据是否站得住」这一维,并且把监督内化进策略,推理时不必再调多个裁判模型。数据效率是卖点:五千题打过十七万题的 outcome RL。代码、模型和训练数据已公开。
这是 7B 级别、维基检索设定下的扎实改进,不是换检索器或换更大模型能随手得到的那种跳变。
标注器是 QwQ-32B 不是 GPT-4o。500 条抽检对 Claude Opus 4.7 的 κ=0.6104,算实质性一致,仍有噪声。MuSiQue 上比 StepSearch 低 1.3 EM,作者归咎于不用闭源教师、偏好对只有 15877,StepSearch 用了 GPT-4o 蒸的约 1.9 万语料。这是可复现性换来的上限损失。
Bamboogle 只有 125 条测试,对 ReasonRAG 的配对 t 检验 p=0.66,表面上的差距分不清是噪声。用 PRM 反馈重生轨迹的增强反而平均掉 10.7 EM,重生轨迹的搜索格式和推理时不一致。主结果也绑在 2018 维基和 k=3 上,换实时搜索或网页环境会不会还成立,没有证据。