CachyLLama实现KV缓存落盘大幅降低本地Agent开销
基于 llama.cpp 的分支项目 CachyLLama 旨在解决本地长会话智能体的提示词处理瓶颈。该项目通过将 KV 缓存持久化落盘到 SSD,大幅减少了长对话中重复 prompt 的处理时间。实测显示,针对包含 15,700 个 token 的提示词,该方案能将其处理时间降至 1 秒以内,有效降低了本地模型的运行开销。
2026-07-25 ~ 2026-07-25 · 2 条相关
- CachyLLama 分支大幅减少长会话重复 prompt 处理 — UsualResult · 2026-07-25
- CachyLLama 把 KV 缓存落盘,15,700 token 提示词降到 1 秒内 — UsedMorning9886 · 2026-07-25