Prompt 缓存比换更便宜模型更省钱
Illustrious-Bug2105 · reddit · 2026-07-26
作者分享了一个很实用的成本优化经验:prompt caching 带来的省钱效果,比直接换更便宜的模型还大。
核心方法是把提示词设计成“大段固定前缀 + 小段可变后缀”,让供应商侧缓存真正命中。这样不仅重复 token 的成本能明显下降,首 token 延迟也会变好,因为前缀不必每次重新处理。
文章也总结了几个常见坑:
- 缓存对顺序和字节内容非常敏感,固定内容必须放在最前面,而且完全一致。
- 时间戳、请求 ID 这类可变字段如果塞在前面,会悄悄破坏缓存命中。
- 缓存过期很快,低频或突发型工作负载往往享受不到收益。
- 一旦开始用缓存,就会反过来要求你按缓存友好的方式重构 prompt。
作者最后抛出一个很实际的问题:在高频生成或 agent 循环里,缓存什么时候比换小模型更划算?
「编程与Agent」频道最新
- Anthropic 称内部 Slack agent 已写出产品团队 65% 代码 — VraserX · 2026-07-26
- Aethos Memory 让 Claude Code、Cursor 和 Windsurf 共用一套持久记忆 — Longjumping-Koala396 · 2026-07-26
- 面向编程智能体的 MCP 记忆服务开源,采用三段式 RAG 检索 — Longjumping-Koala396 · 2026-07-26
- IMO 2026 测试显示 harness 能提分,但前沿模型仍领先一大截 — pequalnp92 · 2026-07-26
- 提示词把任务拆成子代理,再用严苛评审反复迭代 — paul_cal · 2026-07-26
- 开源 Claude Code 技能让 CEO 和 QA 语音 Bot 进会议 — anand__balakrishnan · 2026-07-26