深度研究 agent 砍掉 73% token:早剪比选对打分函数更重要

Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka

cs.AI, cs.IR, cs.MA

2026-08-09

基准 deep research 一份报告烧 37.5 万 token;三阶段轻量剪枝最多砍到 10 万、质量几乎不掉,关键是剪在哪个阶段,不是挑哪种打分。

这篇在解决什么

长程研究 agent 围绕一个开放问题反复检索、聚合、综合,期间上下文一路膨胀,而每多一条证据带来的边际价值往往在递减。后果是 token 越烧越多、延迟越来越长,喂给最后报告生成的输入也越来越嘈杂。作者给了一条基线数字:一个不带显式剪枝的 deep research pipeline,平均一份报告要探索 29 个节点、吃掉 37.5 万 token、跑 3422 秒。问题很直接:能不能把低价值内容更早地清掉。

方法

作者把「这条证据值不值得留」形式化成一个统一的打分函数 V(x | Ct, Q):给定查询 Q 和已累积的上下文 Ct,候选 x 还能不能贡献足够的价值。剪枝能插在流水线的三个点上:

打分函数 V 可以塞很多种实现。轻量启发式这一类不调 LLM、零推理开销,包括 MMR(平衡相关性和冗余)、GRN(残差范数衡量新语义方向)、CD(质心漂移)、DPP(基于行列式的多样性)、SC(按 token 归一化的覆盖),以及把它们组合的 hybrid 和用 TF-IDF 替换稠密向量的词法变体。作者另外试了两种更重的:直接拿 LLM 当剪枝裁判,和一个在执行轨迹上训练的多任务神经网络价值模型。

结果

基准是 DeepResearchGym,从 Researchy Questions 里取 100 条查询,跑 GPT-Researcher 框架。核心结论:

阶段配置最佳效率点token质量(总分)
单阶段·检索后MMR11.46 万(砍 69.5%)56.62(基线 57.83)
三阶段MMR10.01 万(砍 73.3%)55.90
单阶段·综合前Hybrid33.23 万60.68(+2.85,最佳质量)

最省 token 的三阶段 MMR 把 37.5 万压到 10 万出头,质量只从 57.83 掉到 55.90。最反直觉也最重要的发现是:剪在哪个阶段,比用哪种打分函数更重要。早期剪枝(检索前/检索后)省的是真金白银的检索和处理开销,综合前剪枝基本只是在精修最后的上下文。轻量启发式最多砍 73% token 且质量几乎不掉,学到的神经网络模型只在少数权衡点上能与启发式打平,没有任何一种方法在质量、效率、忠实度三个维度同时领先。

作者还特意点明一个权衡:剪枝能保住报告质量,却可能丢掉撑起最高相关度所需的证据,没有任何一种单阶段剪枝方法在 KPR+KPC 相关度指标上超过基线。

为什么重要

对在搭长程 agent 系统的人来说,这篇给的是可直接照搬的工程结论:别一上来就纠结用哪种花哨的打分函数,先把剪枝塞到检索前和检索后这两个早期阶段,拿 MMR 这种零开销启发式跑,大概率能砍掉大半 token 还不掉质量。它也提醒一件事:报告写得流畅和证据留得全,在剪枝之下会分道扬镳,想要最大压缩就接受质量略降,想要最高质量就别指望最大压缩。

局限与存疑

作者自己列了好几条。结论是在固定的 GPT-Researcher pipeline 和 DeepResearchGym 上得出的,换 agent 架构、检索系统或底层 LLM,具体权衡可能变;方法级的质量排序在不同 benchmark 上不如效率结论稳定。质量分是 LLM 裁判打的,换裁判绝对分会大幅漂移,所以质量敏感的结论只能当「固定裁判下的相对比较」看。所有方法都要调阈值,作者给了局部阈值扫描,但更细的方法排名在不同阈值下仍可能变。自动指标只能部分反映事实正确性和对用户的实际有用程度。还有一条伦理提醒:剪枝可能系统性丢掉反方证据、少数观点和重要限定,留下流畅但支撑不足的摘要,建议配上来源透明度和人工复核。

术语

原文与代码

社区讨论

相关论文

全部论文解读