排查 LLM 缓存失效的工具
t4a8945 · reddit · 2026-07-18
作者为本地优先的 LLM harness 做了一个排查工具 cache-hunter,用来捕捉调用里哪些变化会触发缓存失效。
它解决什么问题
在本地跑模型时,prefill 成本会因为缓存失效变得很明显,常见原因包括:
- 消息顺序变化
- system prompt 被改动
- tools 发生变化
- 甚至 reasoningeffort 变化也可能触发失效
使用方式
- 先启动 cache-hunter,让它指向真实的 LLM endpoint
- 在 harness 里把请求指到 cache-hunter 的本地端口
- 点击 Start capture
- 正常跑一遍 session
之后工具会实时展示 session,并用红色单元格标出不稳定的字段。
作者的观察
他已经拿自己的 harness 以及 OpenCode、Claude Code、Cline、Pi、Hermes、Vibe 测过,很多都暴露出:
- system prompt 不稳定
- tools 不稳定
- 顺序不稳定
- 内容不稳定
作者的结论是:这类缓存稳定性检查应该成为 harness 的标准测试项。
「编程与Agent」频道最新
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11