上下文压缩省错层:真正账单是整段重发和缓存写
KitchenAmoeba4438 · reddit · 2026-07-25
上下文压缩常常省错了地方
这篇文章的核心观点是:在工具调用/智能体循环里,真正烧钱的不是最新那段被压缩的文本,而是每次请求都要整段重发的上下文。
- 在长循环中,第 40 轮会再次为前 39 轮买单,整体成本会随轮数近似呈平方增长。
- 缓存读虽然比原始输入便宜,但对一个很长的前缀反复读取,即便命中率很高,累计账单仍然可观。
- 缓存写更贵,而且这类前缀缓存一旦在中间发生修改,后面的内容往往需要整段重写。
- 实操建议是:按“变化频率”来组织上下文,不要在已缓存前缀中间做编辑,并在明确的边界上做摘要重建。
作者还强调,单看 token 数很容易误判,应该同时跟踪 cachecreation 和 cacheread,并用成对实验衡量“每个成功任务的真实成本”。
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11