CachyLLama 分支大幅减少长会话重复 prompt 处理
UsualResult · reddit · 2026-07-25
CachyLLama:给长会话本地 agent 做持久 KV 缓存
CachyLLama 是 llama.cpp 的一个分支,主要解决一个很实际的瓶颈:在长 agent 会话里,反复重新处理同一段 prompt 上下文。
它做了什么
- 增加了 SSD-backed 的持久 KV cache。
- 增加了 system prompt cache。
- 如果请求开头与之前处理过的上下文一致,就能恢复状态,只计算变化的尾部。
- checkpoint 还能在服务重启后继续保留。
作者给出的影响
在项目自己的 7840U/780M 基准里,warm run 比 cold run 快很多:
- 1,243 token:9.3s cold vs 0.41s warm
- 5,409 token:43.3s cold vs 0.57s warm
- 15,700 token:143.1s cold vs 0.99s warm
重要说明
它不会让生成本身变快,只是避免重复做 prompt 评估;这正是长 agent 工作流在慢硬件上最痛的地方。
「编程与Agent」频道最新
- Hermes Agent 给 Docker 沙箱加了凭证防火墙 — NousResearch · 2026-07-25
- Higgsfield 把 Claude 接进 After Effects 做可编辑视频工作 — rohanpaul_ai · 2026-07-25
- LangChain 与 Jensen Huang 讨论企业为何需要开放式 Agent — LangChain · 2026-07-25
- Exa搜索已接入Grok Build的智能体工作流 — TheIshanGoswami · 2026-07-25
- AWS AI工具栈被做成“今天就部署”的梗 — HanchungLee · 2026-07-25
- Yutori 把云端浏览器嵌进首页,直接试玩 computer-use 模型 — DhruvBatra_ · 2026-07-25