实测揭示上下文压缩是陷阱,提示词缓存完胜
AI Engineer · youtube · 2026-08-18
视频深入探讨了 2026 年的上下文工程策略,通过实测数据反驳了常规的上下文压缩实践。核心发现包括:
- 压缩反而更差:在 11 种预设配置下,不做任何压缩的“全历史保留”策略在召回率、成本和延迟上全面胜过所有压缩技术,甚至优于生产环境默认配置。
- 缓存是关键:得益于提示词缓存机制,97% 的 tokens 可直接从缓存读取,且缓存 token 极其廉价。压缩会重写上下文从而破坏缓存,只有当压缩率超过 50 倍时才具有成本优势。
- 记忆损失:保留完整历史能 95% 恢复具体细节,而经过总结压缩后仅剩 32%。在 80 万 token 的长度下,独特事实未见明显腐烂。
- 检索与本地局限:混合搜索工具虽然召回率相同,但速度慢 50%。本地部署受限于 32k 窗口,且更大参数模型并不带来更大上下文。对于深埋在 400k token 处的事实,稠密检索召回率为 0%,而 BM25 依然有效。
结论是:在考虑压缩前,应先明确实际的约束条件。
「Infra」频道最新
- Dyna 公布百万小时视频训练基础设施实践 — JasonMa2020 · 2026-08-18
- Orion 16B 突破 1000 亿训练 Token,利用 DPP 分布式算力 — markjeffrey · 2026-08-18
- Nanbeige4.2-3B 苹果芯片部署优化实战 — John T. Halloran · 2026-08-18
- 野村:AI 公司举债致美债收益率升 0.3% — GaryMarcus · 2026-08-18
- 详解开源 MoE RL 零偏差训练:原理与消融实验 — PandaAshwinee · 2026-08-18
- 实现 MoE RL 零训练推理偏差,Wordle 任务提升求解率 — PandaAshwinee · 2026-08-18