CachyLLama 分支大幅减少长会话重复 prompt 处理
UsualResult · reddit · 2026-07-25
CachyLLama:给长会话本地 agent 做持久 KV 缓存
CachyLLama 是 llama.cpp 的一个分支,主要解决一个很实际的瓶颈:在长 agent 会话里,反复重新处理同一段 prompt 上下文。
它做了什么
- 增加了 SSD-backed 的持久 KV cache。
- 增加了 system prompt cache。
- 如果请求开头与之前处理过的上下文一致,就能恢复状态,只计算变化的尾部。
- checkpoint 还能在服务重启后继续保留。
作者给出的影响
在项目自己的 7840U/780M 基准里,warm run 比 cold run 快很多:
- 1,243 token:9.3s cold vs 0.41s warm
- 5,409 token:43.3s cold vs 0.57s warm
- 15,700 token:143.1s cold vs 0.99s warm
重要说明
它不会让生成本身变快,只是避免重复做 prompt 评估;这正是长 agent 工作流在慢硬件上最痛的地方。
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11