llama.cpp 变体新增 KV Cache「内存盘」PR,可加载更大模型或上下文

giveen · reddit · 2026-09-04

开发者 giveen 在 llama-cpp-turboquant 仓库提交了 PR #326,引入自适应 KV 流(adaptive KV stream)机制,旨在缓解 KV cache 占用过大的问题,让用户能加载稍大的模型或使用更长的上下文。

思路类似给 KV Cache 加一个「内存盘(ram disk)」;代价是文本生成(tg)速度会下降,实际损失程度还取决于内存带宽/速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →