847 次实测:上下文越满指令遵循率从 94% 跌到 41%
Unique-Werewolf-2784 · reddit · 2026-09-23
一位开发者在 r/LocalLLaMA 追踪 847 次 agent 运行后发现:指令遵循率起初 94%,随上下文窗口填满骤降至 41%——不是缓慢下降,而是稳定后「断崖式」跌落。所谓「agent 越聊越笨」,其实是上下文环境在变差。
为什么更大的窗口救不了
- 注意力呈 U 型:模型只关注开头和结尾,窗口越大,被忽略的「中间地带」越大。
- 一些团队超过 60% 的 token 预算是每轮重复注入的同一批内容,却没有任何机制判断哪些还真的需要。
压缩的陷阱:激进摘要会保留故事线、丢掉具体事实——而 agent 恰恰需要靠具体事实行动。作者把一段 18,282 token 的对话压到 122 token,结果比完全不给记忆还差,因为「听起来对但实际错了」。
静默故障案例:某团队记忆层存了 3000+ 文档、仪表盘显示 91 条记忆,但每次 API 检索都返回空,且没有任何报错——比可见的断崖更危险。
作者的做法(其产品 Synap):agent 不再每轮回放历史,而是调用检索,跨向量/图/文件存储取回按 token 预算排序的记忆;压缩时每次调用都报告「多少事实存活」,丢太多就降低压缩力度;检索 P75 < 15ms,生产负载下 token 花费约减半。
自查建议:同一任务在第 5 轮和第 50 轮各测一次准确率,若下降,再区分是注意力断崖还是压缩丢信息——两者外表相似但修法不同。(注:847 次数据来自 r/LocalLLaMA 的另一位开发者,作者本人是 Synap/Maximem 团队成员,带有产品推广背景。)
「编程与Agent」频道最新
- wandb 新玩法:一条命令在终端里直接看实验面板 — wandb · 2026-09-23
- Claude Code 一条命令审计 prompt,清理拖累 Opus 5.5 的反模式 — RLanceMartin · 2026-09-23
- Combos CLI 发布:让 AI agent 生成游戏资产并一键发布 H5 游戏 — lxfater · 2026-09-23
- 开发者用 GPT-6 Sol 做出在线双人 3D 滑雪游戏,全靠 Combos CLI 生成部署 — lxfater · 2026-09-23
- Muse 最早的 UI 设计竟是一个状态胶囊,沿用数月至今 — alexandr_wang · 2026-09-23
- Claude Opus 5.5 写出 35.5 倍加速内核,碾压 GPT-6 Astra 纪录 — scaling01 · 2026-09-23