论文指出生产级 Agent 失效多因上下文失控
omarsar0 · x · 2026-07-25
这篇论文在讲什么
生产级 AI agent 失败,往往不是因为“不会推理”,而是因为上下文管理失控:对话历史、超长 prompt、庞大的工具定义、不断膨胀的工具输出,会在每一轮里越堆越多。
核心主张
作者把这件事定义为 Agentic Context Management(ACM),并拆成五个基本动作:
- 设计上下文结构
- 摄入信息
- 控制作用域
- 预判下一步所需信息
- 通过压缩与整合做上下文精炼
为什么重要
论文认为,朴素的上下文堆积会让 token 成本随对话长度平方级增长;而简单摘要虽然省钱,却很容易在准确性上“断崖式掉点”。真正有效的方案,是经过忠实度验证的压缩,让成本回到线性增长,同时尽量不丢关键信息。
结果
作者给出的参考实现,在两个常见评测上分别达到:
- LongMemEval:92%
- LoCoMo:93.2%
整篇文章的重点是:上下文管理正在变成生产 agent 里的一级工程问题,不只是“存一下、取出来”这么简单。
所属事件:研究提出PRO-LONG框架以优化Agent上下文管理(4 条相关)→
「编程与Agent」频道最新
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11