llama.cpp 分块 KV cache 流式传输 PR:长上下文显存封顶
giveen · reddit · 2026-09-06
开发者 giveen 向 llama-cpp-turboquant 提交 Pull Request #357,实现 Block KV cache 流式传输,通过共享 CUDA phase arena 为长上下文推理设定显存上限。作者坦言核心工作来自 Raymond Huang 的 llama.cpp-adaptive-kv-streaming(Raymond 曾表示做得更好),自己将该方法移植到 turboX,并从 Raymond 仅支持的 Qwen 系列扩展到多个其他模型,同时做了详尽 benchmark 验证收益。对本地部署长上下文推理的用户,这是降低显存占用的实用优化方向。
「Infra」频道最新
- 日本披露 5500 亿美元对美投资协定进展,AI 与半导体将占「极重要」角色 — Polymarket · 2026-09-06
- QuixiAI 开源 SlimServe:配套 3090 集群推理方案的项目仓库 — QuixiAI · 2026-09-06
- 8 张 RTX 3090 跑 262K 上下文,Qwen3.8-Flash-Next 达 1200 tok/s — QuixiAI · 2026-09-06
- T-Glass短缺加剧,Kinsus高端ABF月营收损失10-15% — zephyr_z9 · 2026-09-06
- 无凸点混合键合走向实用:Intel Diamond Rapids 率先落地,AMD Zen 传闻跟进 — bookwormengr · 2026-09-06
- Reddit 网友晒本地跑 AI 的硬件配置:大内存主机+轻终端远程访问 — Fun_Kangaroo512 · 2026-09-06