When Deep Research Agents Stagnate: Enhancing Reasoning with Retrieval-Aware Agent Control
Heydar Soudani, Elizabeth Lingg, Faegheh Hasibi, Navid Rekabsaz
cs.IR
2026-08-15
七个深度研究 Agent 外挂一个检索感知控制器后,平均少打 14 次搜索、准确率平均涨 3%、最高涨 10%,控制器自身延迟开销约 10%。
Deep Research Agent(DRA,带搜索工具的多步推理 agent)已经遍地开花,但很少有人追问:跑完几十轮搜索之后,到底哪几轮在起作用。这篇把 7 个主流 DRA(ReAct、GLM-4.7、GPT-oss-20b、Tongyi-DR、AgentCPM-Explore、WebWeaver、AgentCPM-Report,覆盖指令微调、RL 训练、大纲引导、报告生成四种架构)的推理轨迹逐轮拆开,用中间召回率和中间准确率逐点打分,发现一个跨架构的通病:reasoning stagnation,推理停滞。头几轮搜索之后性能迅速饱和,后续大量迭代对最终结果没有贡献;agent 检索到的新文档越来越少,反复重访已经看过的页面。一个真实轨迹里,答案在第 8 轮就已到手,agent 仍旧跑满 23 轮。症结是 agent 对自己的轨迹没有感知:不知道哪些信息已经覆盖、该不该换方向、什么时候该停。
RAAC(Retrieval-Aware Agent Controller)是一个 agent 无关的外挂控制器,不改 agent 本体。每轮迭代算四个无监督信号:
控制器拿着信号在三个动作里选:continue 放行;intervene 调一个 critical re-thinker,批判当前轨迹为何停滞并生成一个差异化的新查询;stop 判定信息已挖尽,强制收尾生成答案。信号计算用 Qwen3-Embedding-4B,控制器与 re-thinker 用 Claude Sonnet 4.5,全部免训练。
三个数据集(BrowseComp-Plus、NeuCLIR24、Thomson Reuters 的 LegalSearch)上,加上 RAAC 后性能全线不降、多数显著上涨,搜索调用数大幅下降:
| Agent(基线→+RAAC) | 指标 | BrowseComp-Plus |
| Tongyi-DR | Accuracy | 37.9 → 47.9 |
| Tongyi-DR | Recall | 48.4 → 59.0 |
| WebWeaver | Recall / Acc | 64.9→67.2 / 47.8→51.3 |
| WebWeaver | 搜索调用 | 75.0 → 50.7(降 33%) |
| Tongyi-DR | 搜索调用(NeuCLIR) | 62.1 → 34.4(降 45%) |
| 全体 | 迭代数(LegalSearch) | 平均降 58% |
BrowseComp-Plus 上平均准确率涨 3 点、最高涨 10 点(Tongyi-DR),平均搜索调用少 14 次。唯一的例外反而印证了机制:AgentCPM-Report 本来倾向于过早收手,RAAC 让它多搜,recall 从 18.6 涨到 30.5。消融显示 Nov 是最有效的主信号;Cov 只在问题自带人工条件时有帮助,LLM 自动生成的条件在另外两个数据集上不涨分。控制器自身每查询延迟开销约 10%,对照省下的约 33% 搜索量,净赚。
所有在跑 deep research 类产品的团队可以直接借鉴:停滞是跨架构的普遍现象,一个免训练的外挂控制器同时降成本、降延迟、提准确率,不用重训 agent。stop 组的 win/loss 分析(赢 35% 输 18%)也说明干预动作是在重定向轨迹,不是瞎打断。
作者自列三条:控制器是手工 prompt 把信号映射到三个离散动作,权重固定、不随问题类型自适应;信号体系只有四个,文档内容、检索置信度、文档间冗余都没试;动作集只有 continue/intervene/stop。读下来再补两点存疑:critical re-thinker 本身也是 LLM,一个 LLM 能否可靠判断另一个 LLM 的停滞,论文只给了间接证据;LegalSearch 是 Thomson Reuters 的闭源数据集(一作在此实习),这部分结果外部无法复现。