ContextPilot 用 RL 教 agent 主动管理上下文,四项基准平均 69.4 分
rohanpaul_ai · x · 2026-09-03
论文《ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL》提出:长时运行 agent 的问题不只是上下文窗口不够大,而是模型需要学会「什么值得留在上下文里」。
- ContextPilot 让 agent 自主规划并执行保存长期记忆、摘要、压缩、删除旧上下文等操作,再用细粒度 RL 训练哪些上下文决策真正有用
- 基于 Qwen3-8B 训练的 ContextPilot-8B-RL 在 4 个长上下文基准上平均 69.40 分,而同一模型用 128K 窗口仅 45.93
- 在 BrowseComp 上,其每轮上下文稳定在 8K–10K token,WebExplorer-8B 则增长到约 30K
- 核心建议:不要把全部对话历史当记忆,给 agent 一个可主动管理的较小工作上下文,并训练它保留关键信息
「编程与Agent」频道最新
- Claude 虚拟机硬盘占用竟达 22GB,开发者直呼离谱 — DevDminGod · 2026-09-03
- 开发者预测:上下文压缩将被 agent 式检索会话历史取代 — mayfer · 2026-09-03
- 不会写代码的农民只用手机:零信任方法论在 Termux 里管数十万行 AI 代码 — amadale · 2026-09-03
- 多智能体调试痛点:逐 agent 日志难还原决策链,需要统一 trace 视图 — mageblex · 2026-09-03
- OpenAI CUA 示例应用新增 JS/Python 两套计算机操作环境镜像 — ChrisGPT · 2026-09-03
- 2 小时纯 vibe coding 复刻 Opera Neon:本地异构算力驱动的 agentic 浏览器 — comperr · 2026-09-03