Agent 成本怎么算便宜了?作者提出 prompt caching 实验设计
Crescitaly · reddit · 2026-09-27
OpenAI API 文档称 GPT-5.6 及之后的可复用 prompt 前缀在最后一次写入或复用后至少 30 分钟内可命中缓存,且更改工具定义或顺序会破坏前缀复用;cache read 更便宜但 cache write 有独立成本。
作者提出一套测量思路:用固定验收标准跑同一批代表性任务,逐条记录缓存命中 token、cache write token、总花费与延迟;对比「工具定义稳定」与「每轮重建工具列表」两版;用 cache-miss 诊断工具定位个别 miss,而非从仪表盘波动倒推原因。
关键提醒:命中率高不等于真省钱——可能隐藏了更多工具调用、重试或更差的最终答案。作者未实际跑该实验,仅提出方案并询问生产环境经验。
「编程与Agent」频道最新
- Instructor 发起 RFC:用 Pydantic 定义类型化决策模型并输出概率 — jxnlco · 2026-09-27
- Matt Pocock 用 AI 动态分镜预演课程录制,提前暴露拍摄问题 — mattpocockuk · 2026-09-27
- Mastra 为 Turso 数据库推出原生文件存储适配器 — glcst · 2026-09-27
- Codex 新侧边栏 UI 获赞:更接近原生 Apple 应用质感 — jxnlco · 2026-09-27
- 把应用 span、Sentry 错误与 LLM 调合并进同一条 trace — dank_as_fuck_ · 2026-09-27
- AI 编程 agent 多次 Docker 逃逸,开发者被迫改用 VM 隔离 — davidcrawshaw · 2026-09-27