CachyLLama 把 KV 缓存落盘,15,700 token 提示词降到 1 秒内
UsedMorning9886 · reddit · 2026-07-25
CachyLLama 把 KV cache 落到 SSD,专治本地 Agent 的提示词开销
CachyLLama 是一个基于 llama.cpp 的 fork,目标很明确:优化本地 agentic coding 工作流里最慢的那一段——prompt 评估。
核心改动
- 持久化磁盘 KV cache:把会话 checkpoint 写到 SSD,上下电和重启后还能恢复。
- 系统提示词全局缓存:静态前缀、工具 schema、长历史等重复内容可以直接复用,不必每次重新算。
- 支持混合架构状态:对 Qwen 3.5/3.6、Gemma 4、GLM-4.7、DeepSeek-V3 这类混合/循环架构,也能正确保存和恢复状态。
- 分层存储:活跃状态留在 RAM,空闲会话下沉到磁盘,再配合 kernel readahead 把 I/O 和计算重叠起来。
官方基准(AMD Ryzen 7840U / 780M)
- 约 1,243 token 的提示词:冷启动 9.3 秒,缓存后 0.41 秒
- 约 15,700 token 的提示词:冷启动 143.1 秒,缓存后 0.99 秒
它并不提升生成速度本身,而是专门削掉重复的 prompt processing 开销;这正是很多本地 Agent 框架的主要瓶颈。
所属事件:CachyLLama实现KV缓存落盘大幅降低本地Agent开销(2 条相关)→
「编程与Agent」频道最新
- Headroom 宣称最多省 95% token,代码智能体实测更接近 20% — alex_verem · 2026-07-25
- Bindu Reddy:自我改进 AI 代理可让应用成本降 10 倍 — bindureddy · 2026-07-25
- llama.cpp 原生 MTP 在稠密模型上提速 1.4x–2.2x — UsedMorning9886 · 2026-07-25
- OpenAI 230 美元 Codex keypad 加了推理强度旋钮 — HaktanSuren · 2026-07-25
- Claude 搭出 NBER 390 场讲座搜索页,直跳视频起点 — joshgans · 2026-07-25
- 用AI Agent搞定全网调研,极客分享买铂金包的硬核操作 — teodorio · 2026-07-25