CachyLLama实现KV缓存落盘大幅降低本地Agent开销

基于 llama.cpp 的分支项目 CachyLLama 旨在解决本地长会话智能体的提示词处理瓶颈。该项目通过将 KV 缓存持久化落盘到 SSD,大幅减少了长对话中重复 prompt 的处理时间。实测显示,针对包含 15,700 个 token 的提示词,该方案能将其处理时间降至 1 秒以内,有效降低了本地模型的运行开销。

2026-07-25 ~ 2026-07-25 · 2 条相关