EviBack 用教师回退训练 agentic RAG 的零奖励轨迹

_reachsumit · x · 2026-07-28

这篇论文提出了 EviBack,目标是解决 agentic RAG 训练里一个常见难题:当一组 rollout 全部拿到 0 reward 时,强化学习缺少比较信号,但这些失败轨迹里可能仍然藏着有价值的搜索行为。

论文的做法是引入一个 evidence-constrained Teacher backoff:

作者报告称,这套方法在 7 个开放域 QA benchmark 和 3 个 Qwen3 规模上,提升了下游 F1 和有效答案率,同时减少了搜索次数、重复查询和强制终止。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →