ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen
cs.AI
2026-08-06
从正确答案倒推证据线索、给搜索每一步单独打分,这套逐步信用分配让 4B 的 ABSeeker 在 BrowseComp 拿到 55.3%,追平 30B 智能体。
深度研究类的搜索智能体(如 OpenAI Deep Research、Tongyi DeepResearch)要靠几十轮「检索—浏览—整合」才能答出一个问题:反复改查询词、读网页、修正假设。训练这类智能体有个老问题,信用分配。标准做法里,监督微调(SFT)和强化学习(RL)都把一条轨迹里的所有步骤一视同仁:答对的轨迹整条都算对,答错的整条都算错。这跟事实对不上。一条成功的轨迹里常常夹着走错或多余的步骤,一条失败的轨迹里也常常有那一步恰好挖到了决定性证据。把它们一律奖、一律罚,等于把最有信息量的信号扔了。
上交团队提出的 ABC(Answer-Backtracked Credit Assignment)分两步把稀疏的「最终对错」变成稠密的「逐步分数」。
第一步是答案回溯的线索恢复。给定问题和它的标准答案,用一个 LLM(论文用 DeepSeek-V4-Flash)从答案往回倒推,自己边搜网页边把解题必需的中间「线索」捞出来:实体、事实、关系。比如答案是 CeraVe,恢复出的线索就有「神经酰胺(有临床支持的成分)」「L'Oréal(收购方)」「创始人 Eugène Schueller 1904 年毕业」等,每条都锚定在真实网页内容上。
第二步是线索锚定的逐步打分。轨迹里每一步对着线索集打分,基准分 1.0:发现或验证一条正确线索 +0.8,正确排除一个错误候选 +0.4,错误地否定一条正确线索 -0.8,提交正确答案 +1.0,提交错误答案 -1.0,最后截断到 [0, 2.0]。于是失败轨迹里的好步骤照样拿正分,成功轨迹里的坏步骤照样被罚。
拿到逐步分数后,ABC-SFT 按分数用 sigmoid 重新加权每一轮的损失;ABC-GRPO 直接把逐步分数当 GRPO 的奖励,用折扣的逐步优势(γ=0.25)更新策略。ABSeeker 用 Qwen3.5-4B 训练,只用 8.5k 条轨迹(5.5k 对、3.0k 错),对的和错的轨迹都留着。
五个基准(允许最多 200 次工具调用,跑三次取平均):
| 基准 | ABSeeker (4B) | 同档 4B 对照 | 30B 参考 |
| BrowseComp | 37.3 / 55.3 | QUEST-4B 40.0 | MiroThinker 67.9 |
| BrowseComp-ZH | 39.1 / 52.9 | DR-Venus 37.7 | MiroThinker 72.3 |
| xbench-2505 | 77.0 | DR-Venus 74.7 | Tongyi-DR 75.0 |
| xbench-2510 | 46.0 | DR-Venus 40.7 | MiroThinker 57.2 |
| GAIA-text | 81.6 | QUEST-4B 77.7 | MiroThinker 80.3 |
带上下文管理(256K 窗口、最多 5 轮全丢弃)。
带上上下文管理,ABSeeker 在 4B 档每个基准都第一;不带时 BrowseComp 37.3% 略低于 QUEST-4B 的 40.0%。在 xbench-2505(77.0)和 GAIA-text(81.6)上,它压过所有上报的 30B 智能体。上下文管理把 BrowseComp 从 37.3% 抬到 55.3%、BrowseComp-ZH 从 39.1% 到 52.9%。奖励分布分析显示:成功轨迹里约 4% 的步骤其实是低质步骤(分低于 1.0),失败轨迹里约 10% 的步骤分高于 1.0。消融里 ABC-SFT 稳定优于标准 SFT,ABC-GRPO 稳定优于轨迹级 GRPO。模型只在 BrowseComp 风格问题上训过,却能迁到 xbench 和 GAIA。
信用分配这套思路是真正可复用的贡献。只要一个长程任务的最终答案能让问题「可回溯」(数学题、多跳问答、工具使用都算),就能套答案回溯的逐步打分。8.5k 样本、4B 体量追平 30B,说明在这类任务上,过程监督比堆参数更值钱。对做深度研究或搜索智能体的人,打分规则和 ABC-SFT、ABC-GRPO 的配方都开源了(代码在 GitHub、模型在 HuggingFace)。但得看清:55.3% 的标题数字是靠上下文管理撑起来的,去掉它只有 37.3%。
只测了 4B,受算力所限没验证更大模型上增益是否还在。线索恢复和逐步打分都依赖一个强判官模型(DeepSeek-V4-Flash),整条管线的质量天花板被它卡住,判官捞错线索或打错分,监督就被污染,论文没深入分析判官误差。训练只用 BrowseComp 风格的问题(答案唯一可验证),这套回溯依赖「有唯一可验证答案」;没有标准答案的开放式研究问题套不进来。55.3% 的标题数字离不开沉重的上下文管理外壳,方法本身的净增益(同设定下对基线的提升)比标题温和得多。最后,评估 correctness 也靠 LLM 判,虽跑了三次取平均,判官方差仍在。