PRO-Step:步级过程奖励优化 RAG,拿下五个基准最佳 EM/F1

_reachsumit · x · 2026-09-03

论文提出 PRO-STEP,针对 RAG 多跳推理中的错误传播问题:标准结果级优化只看最终答案,已有过程级方法仍以最终答案为参照打分,会奖励「错误检索碰巧答对」的伪成功。方法要点:

在单跳与多跳 QA 的五个基准上取得最佳平均 EM 与 F1,代码、模型与训练数据已开源,被 EMNLP 2026 接收。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →