847 次实测:上下文越满指令遵循率从 94% 跌到 41%

Unique-Werewolf-2784 · reddit · 2026-09-23

一位开发者在 r/LocalLLaMA 追踪 847 次 agent 运行后发现:指令遵循率起初 94%,随上下文窗口填满骤降至 41%——不是缓慢下降,而是稳定后「断崖式」跌落。所谓「agent 越聊越笨」,其实是上下文环境在变差。

为什么更大的窗口救不了

压缩的陷阱:激进摘要会保留故事线、丢掉具体事实——而 agent 恰恰需要靠具体事实行动。作者把一段 18,282 token 的对话压到 122 token,结果比完全不给记忆还差,因为「听起来对但实际错了」。

静默故障案例:某团队记忆层存了 3000+ 文档、仪表盘显示 91 条记忆,但每次 API 检索都返回空,且没有任何报错——比可见的断崖更危险。

作者的做法(其产品 Synap):agent 不再每轮回放历史,而是调用检索,跨向量/图/文件存储取回按 token 预算排序的记忆;压缩时每次调用都报告「多少事实存活」,丢太多就降低压缩力度;检索 P75 < 15ms,生产负载下 token 花费约减半。

自查建议:同一任务在第 5 轮和第 50 轮各测一次准确率,若下降,再区分是注意力断崖还是压缩丢信息——两者外表相似但修法不同。(注:847 次数据来自 r/LocalLLaMA 的另一位开发者,作者本人是 Synap/Maximem 团队成员,带有产品推广背景。)

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →