EviBack 用教师回退训练 agentic RAG 的零奖励轨迹
_reachsumit · x · 2026-07-28
这篇论文提出了 EviBack,目标是解决 agentic RAG 训练里一个常见难题:当一组 rollout 全部拿到 0 reward 时,强化学习缺少比较信号,但这些失败轨迹里可能仍然藏着有价值的搜索行为。
论文的做法是引入一个 evidence-constrained Teacher backoff:
- 对全零 reward 的 rollout 组提供辅助监督
- 将“证据判断”和“答案润色”分开,避免参考答案掩盖“证据不足”的问题
- 用一个自动化的、GPT-5.5 辅助的 APE 流水线,把手工设计的单一双任务 prompt 进一步拆分、标注、筛选成一个带门控的两阶段 Teacher
作者报告称,这套方法在 7 个开放域 QA benchmark 和 3 个 Qwen3 规模上,提升了下游 F1 和有效答案率,同时减少了搜索次数、重复查询和强制终止。
「编程与Agent」频道最新
- Claude Opus 5一次生成多人FPS游戏 — TAbrodi · 2026-07-28
- Ycode 推出网站 AI Agent,可接 Claude、ChatGPT、Gemini 或 Grok — JaynitMakwana · 2026-07-28
- 一张 Claude agent 梗图把提示词写成职场霸凌 — pranavmarla · 2026-07-28
- 受控研究发现,多智能体平均只比单 agent 高 0.0% — bravo_abad · 2026-07-28
- 编程 Agent 该持久化审批、工具轨迹和验证结果 — DesktopLabHQ · 2026-07-28
- Codex Computer Use 展现出明显 PMF:电脑工作被大幅压缩 — hudzah · 2026-07-28