PRO-Step:步级过程奖励优化 RAG,拿下五个基准最佳 EM/F1
_reachsumit · x · 2026-09-03
论文提出 PRO-STEP,针对 RAG 多跳推理中的错误传播问题:标准结果级优化只看最终答案,已有过程级方法仍以最终答案为参照打分,会奖励「错误检索碰巧答对」的伪成功。方法要点:
- 训练生成式过程奖励模型(PRM),对每一步同时评估逻辑有效性与证据支撑度;
- 用 PRM 引导的值树搜索构建偏好对,对比有效步骤与缺陷步骤;
- 通过步级 DPO 优化策略模型。
在单跳与多跳 QA 的五个基准上取得最佳平均 EM 与 F1,代码、模型与训练数据已开源,被 EMNLP 2026 接收。
「研究」频道最新
- SimLoss 单遍细粒度图像描述,低延迟媲美多阶段方法 — Suryaansh Jain · 2026-09-03
- Tenstorrent 联手日本机构推 JapanFold,免费提供开源制药模型推理 — DavidBennett__ · 2026-09-03
- Until 用 AI 把低温保护剂候选分子筛到 25 万个 — NirantK · 2026-09-03
- 推友激辩:CoT 提示是不是一种参数复用? — aryaman2020 · 2026-09-03
- LL(1) 语法约束解码实测:消除 Agent 语法错误,高层失误仍在 — Upstairs-Special-925 · 2026-09-03
- Nora 优化器:只取 Muon 矩阵结构精华,避开全量预处理开销 — burkov · 2026-09-03