深度研究 Agent 大半搜索在空转,外挂控制器平均砍 14 次调用还涨 10 分

When Deep Research Agents Stagnate: Enhancing Reasoning with Retrieval-Aware Agent Control

Heydar Soudani, Elizabeth Lingg, Faegheh Hasibi, Navid Rekabsaz

cs.IR

2026-08-15

七个深度研究 Agent 外挂一个检索感知控制器后,平均少打 14 次搜索、准确率平均涨 3%、最高涨 10%,控制器自身延迟开销约 10%。

这篇在解决什么

Deep Research Agent(DRA,带搜索工具的多步推理 agent)已经遍地开花,但很少有人追问:跑完几十轮搜索之后,到底哪几轮在起作用。这篇把 7 个主流 DRA(ReAct、GLM-4.7、GPT-oss-20b、Tongyi-DR、AgentCPM-Explore、WebWeaver、AgentCPM-Report,覆盖指令微调、RL 训练、大纲引导、报告生成四种架构)的推理轨迹逐轮拆开,用中间召回率和中间准确率逐点打分,发现一个跨架构的通病:reasoning stagnation,推理停滞。头几轮搜索之后性能迅速饱和,后续大量迭代对最终结果没有贡献;agent 检索到的新文档越来越少,反复重访已经看过的页面。一个真实轨迹里,答案在第 8 轮就已到手,agent 仍旧跑满 23 轮。症结是 agent 对自己的轨迹没有感知:不知道哪些信息已经覆盖、该不该换方向、什么时候该停。

方法

RAAC(Retrieval-Aware Agent Controller)是一个 agent 无关的外挂控制器,不改 agent 本体。每轮迭代算四个无监督信号:

控制器拿着信号在三个动作里选:continue 放行;intervene 调一个 critical re-thinker,批判当前轨迹为何停滞并生成一个差异化的新查询;stop 判定信息已挖尽,强制收尾生成答案。信号计算用 Qwen3-Embedding-4B,控制器与 re-thinker 用 Claude Sonnet 4.5,全部免训练。

结果

三个数据集(BrowseComp-Plus、NeuCLIR24、Thomson Reuters 的 LegalSearch)上,加上 RAAC 后性能全线不降、多数显著上涨,搜索调用数大幅下降:

Agent(基线→+RAAC)指标BrowseComp-Plus
Tongyi-DRAccuracy37.9 → 47.9
Tongyi-DRRecall48.4 → 59.0
WebWeaverRecall / Acc64.9→67.2 / 47.8→51.3
WebWeaver搜索调用75.0 → 50.7(降 33%)
Tongyi-DR搜索调用(NeuCLIR)62.1 → 34.4(降 45%)
全体迭代数(LegalSearch)平均降 58%

BrowseComp-Plus 上平均准确率涨 3 点、最高涨 10 点(Tongyi-DR),平均搜索调用少 14 次。唯一的例外反而印证了机制:AgentCPM-Report 本来倾向于过早收手,RAAC 让它多搜,recall 从 18.6 涨到 30.5。消融显示 Nov 是最有效的主信号;Cov 只在问题自带人工条件时有帮助,LLM 自动生成的条件在另外两个数据集上不涨分。控制器自身每查询延迟开销约 10%,对照省下的约 33% 搜索量,净赚。

为什么重要

所有在跑 deep research 类产品的团队可以直接借鉴:停滞是跨架构的普遍现象,一个免训练的外挂控制器同时降成本、降延迟、提准确率,不用重训 agent。stop 组的 win/loss 分析(赢 35% 输 18%)也说明干预动作是在重定向轨迹,不是瞎打断。

局限与存疑

作者自列三条:控制器是手工 prompt 把信号映射到三个离散动作,权重固定、不随问题类型自适应;信号体系只有四个,文档内容、检索置信度、文档间冗余都没试;动作集只有 continue/intervene/stop。读下来再补两点存疑:critical re-thinker 本身也是 LLM,一个 LLM 能否可靠判断另一个 LLM 的停滞,论文只给了间接证据;LegalSearch 是 Thomson Reuters 的闭源数据集(一作在此实习),这部分结果外部无法复现。

术语

原文与代码

社区讨论

相关论文

全部论文解读