EviSD:用证据蒸馏优化搜索智能体动作信用分配

_reachsumit · x · 2026-08-04

论文提出了一个名为 EviSD 的证据条件自蒸馏框架,旨在解决基于结果的强化学习(如 GRPO)在多轮搜索过程中,无法有效区分单个动作贡献的痛点。

核心机制:

实验效果:在 7 个问答基准和 3 种不同规模的主干模型上,EviSD 在所有设置中均取得了最高的宏观平均 Exact Match,比最强基线高出 1.3-2.3 个百分点,且仅调节了 6.7%-15.1% 的 Token。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →