上下文压缩省错层:真正账单是整段重发和缓存写
KitchenAmoeba4438 · reddit · 2026-07-25
上下文压缩常常省错了地方
这篇文章的核心观点是:在工具调用/智能体循环里,真正烧钱的不是最新那段被压缩的文本,而是每次请求都要整段重发的上下文。
- 在长循环中,第 40 轮会再次为前 39 轮买单,整体成本会随轮数近似呈平方增长。
- 缓存读虽然比原始输入便宜,但对一个很长的前缀反复读取,即便命中率很高,累计账单仍然可观。
- 缓存写更贵,而且这类前缀缓存一旦在中间发生修改,后面的内容往往需要整段重写。
- 实操建议是:按“变化频率”来组织上下文,不要在已缓存前缀中间做编辑,并在明确的边界上做摘要重建。
作者还强调,单看 token 数很容易误判,应该同时跟踪 cachecreation 和 cacheread,并用成对实验衡量“每个成功任务的真实成本”。
「编程与Agent」频道最新
- Claude Code 触发拒绝后可静默回退到 Opus 4.8 — steipete · 2026-07-25
- 2小时用AI克隆年入1300万美元的App,附完整实操指南 — PrajwalTomar_ · 2026-07-25
- Stardock 用 AiClairvoyance 让项目经理 AI 自己招人 — draginol · 2026-07-25
- tldraw offline 下载破 1.3 万,周一加上 Pi agent skills — max__drake · 2026-07-25
- ComfyUI 教程演示 LTX 2.3 运动引导全流程 — nghtdrp · 2026-07-25
- 有人在做面向小诊所的 AI 前台,接电话和预约都能接管 — Icy_Current9287 · 2026-07-25