ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun
EMNLP 2026 (Main Track)
cs.CL
2026-08-29
给 agent 加上规划、长期记忆和软卸载工具,再用上下文长度变化与熵挑关键编辑做分支采样。ContextPilot-8B-RL 在四项长上下文任务上均分 69.40,比 StateLM-8B-RL 高 3.55 分。
长程 agent 一多轮,工作上下文就线性膨胀。规则截断或定时摘要把模型当成被动接受者。StateLM 这类主动上下文管理已经让模型自己搜、删、摘要,但工具箱偏窄,规划、长期记忆和可恢复的压缩基本没有。更麻烦的是训练:一次上下文编辑会改写后面整段历史,不同编辑对最终对错的影响方差差很大,却仍把整条轨迹的终局奖励均摊给中间每一步。
ContextPilot 要解决的是:工具不够用,探索预算没有花在真正改历史的那几步上,学分也算得太粗。
工具在 StateLM 的搜索、删除、摘要之上加了三类。规划侧有 plan、analyzeText、checkBudget。长期记忆用 memorize 抽出实体、时间和事件并建边,再用 readMemory 连邻居一起取回。软卸载包括 summarizeContext、用 LLMLingua-2 的 compressContext,以及 foldHistory:把历史折成关键词加摘要,之后还能按关键词搜回来。改历史的操作会把轨迹切成快照,后续训练按快照看,不按整条轨迹看。
SFT 用带脚手架的 teacher(Qwen3.5-397B-A17B)合成轨迹,提示和重试只在生成时出现,不进最终数据。RL 有两处专门设计。上下文感知的部分展开用上下文长度相对变化加相对初始熵的变化给每个管理动作打敏感分,全局快照预算里先做整轨采样,余量分给敏感分最高的编辑点再分叉。细粒度学分不再把终局奖励复制给每个中间快照,而是对所有经过该快照的终局轨迹取平均,再在同一 query 的快照组里做 GRPO。
长上下文 QA 的基座是 Qwen3-8B/14B 和 Gemma4-E4B-it;深度搜索跳过 SFT,直接在 WebSailor-7B 和 WebExplorer-8B 上用 1,000 条 OpenSeeker 样本做 RL。推理输入上限 32K。
长上下文 QA,三次运行均值:
| 方法 | 窗口 | NovelQA | ∞Bench | LongMemEval-S | BrowseComp+ | 均分 |
| StateLM-8B-RL | 32K | 84.15 | 73.07 | 59.73 | 46.44 | 65.85 |
| ContextPilot-8B-RL | 32K | 83.88 | 75.25 | 64.27 | 54.18 | 69.40 |
| ContextPilot-14B-RL | 32K | 84.81 | 81.08 | 67.40 | 55.50 | 72.20 |
| Qwen3.5-397B + 工具 | 32K | 91.94 | 92.13 | 83.60 | 80.96 | 87.16 |
8B-RL 比同尺寸 StateLM 高 3.55 分,BrowseComp+ 上高 7.74 分。SFT 已见过 NovelQA 的另一划分,RL 在 NovelQA 上只再涨约 1.3 分,在平均输入约 552K 的 BrowseComp+ 上却涨 5.34 分。Qwen3-8B 裸用 128K 窗口均分只有 45.93,工具 prompt 不训练会掉到 27.61,说明工具要练才会用。
深度搜索上,WebExplorer-8B 的 ContextPilot 均分 50.10,高于 SUPO 的 49.09 和同数据、无上下文工具的 OpenSeeker 的 47.92。BrowseComp 上工作上下文从基线尾段约 30K token 压到每轮约 8K–10K。教师模型上逐步加规划、软卸载、长期记忆,均分从 77.89 走到 87.16,BrowseComp+ 从 63.49 走到 80.96。Qwen3-8B 的 RL 消融里,只看熵的部分展开并不稳,加上上下文变化后再做细粒度学分,均分从 SFT 的 65.78 到 69.40。
32K 窗口打过 128K 裸上下文,说明长程 agent 的瓶颈经常是「怎么管自己的工作记忆」,不是再买一档窗口。对已经在跑 ReAct 搜索 agent 的人,这套工具和学分规则可以直接迁到现有轨迹快照训练里。
增益是渐进的,不是换范式。深度搜索上相对 SUPO 只高约 1.5 分,价值更多在上下文更短、工具用得更像管理者。代码和模型权重已公开。
作者承认工具仍覆盖不了全部编辑需求,超参没有做充分搜索,评测也停在长上下文 QA 和深度搜索,没有 coding agent 或 GUI agent。SFT 轨迹来自带约束的 teacher,真实部署里没有这层脚手架,行为可能打折。BrowseComp+ 挂在长上下文 QA 下,因为它用固定语料、不上网,跟真·网络搜索仍有差距。部分展开增加了采样成本,论文没有把这笔账算清楚。