llama.cpp 分块 KV cache 流式传输 PR:长上下文显存封顶

giveen · reddit · 2026-09-06

开发者 giveen 向 llama-cpp-turboquant 提交 Pull Request #357,实现 Block KV cache 流式传输,通过共享 CUDA phase arena 为长上下文推理设定显存上限。作者坦言核心工作来自 Raymond Huang 的 llama.cpp-adaptive-kv-streaming(Raymond 曾表示做得更好),自己将该方法移植到 turboX,并从 Raymond 仅支持的 Qwen 系列扩展到多个其他模型,同时做了详尽 benchmark 验证收益。对本地部署长上下文推理的用户,这是降低显存占用的实用优化方向。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →