论文指出生产级 Agent 失效多因上下文失控
omarsar0 · x · 2026-07-25
这篇论文在讲什么
生产级 AI agent 失败,往往不是因为“不会推理”,而是因为上下文管理失控:对话历史、超长 prompt、庞大的工具定义、不断膨胀的工具输出,会在每一轮里越堆越多。
核心主张
作者把这件事定义为 Agentic Context Management(ACM),并拆成五个基本动作:
- 设计上下文结构
- 摄入信息
- 控制作用域
- 预判下一步所需信息
- 通过压缩与整合做上下文精炼
为什么重要
论文认为,朴素的上下文堆积会让 token 成本随对话长度平方级增长;而简单摘要虽然省钱,却很容易在准确性上“断崖式掉点”。真正有效的方案,是经过忠实度验证的压缩,让成本回到线性增长,同时尽量不丢关键信息。
结果
作者给出的参考实现,在两个常见评测上分别达到:
- LongMemEval:92%
- LoCoMo:93.2%
整篇文章的重点是:上下文管理正在变成生产 agent 里的一级工程问题,不只是“存一下、取出来”这么简单。
「编程与Agent」频道最新
- OpenRouter 推出分类器测试版,给模型路由打标签并可视化 — AccBalanced · 2026-07-25
- OpenAI 让 ChatGPT Work 代理可登录网站并保留会话 — nickbaumann_ · 2026-07-25
- Codex 工作流技巧:先画流程,再让它实现 — alex_frantic · 2026-07-25
- 微软 OpenForgeRL:在真实部署 harness 中训练智能体 — dair_ai · 2026-07-25
- Gemini CLI 修复 Windows diff 视图的 CRLF 行尾问题 — luisfelipe-alt · 2026-07-25
- VaynerX 用 Claude 在几小时内做出原本要价 2 万美元的内部应用 — tomcrawshaw01 · 2026-07-25