llama.cpp 变体新增 KV Cache「内存盘」PR,可加载更大模型或上下文
giveen · reddit · 2026-09-04
开发者 giveen 在 llama-cpp-turboquant 仓库提交了 PR #326,引入自适应 KV 流(adaptive KV stream)机制,旨在缓解 KV cache 占用过大的问题,让用户能加载稍大的模型或使用更长的上下文。
思路类似给 KV Cache 加一个「内存盘(ram disk)」;代价是文本生成(tg)速度会下降,实际损失程度还取决于内存带宽/速度。
「Infra」频道最新
- AI 服务器需求强劲,HPE Q3 超预期并上调 2026 财年展望 — mattwbaker · 2026-09-04
- Chromium 内核浏览器存数据丢失 bug,连 Google 也难修 — uwukko · 2026-09-04
- 数百人抗议苏格兰数据中心热潮,吁暂停至少20个新建项目 — nordicinst · 2026-09-04
- OpenAI、Anthropic、xAI 同日集体宕机,三大模型厂服务同时中断 — pstAsiatech · 2026-09-04
- ChatGPT 宕机时他用双 RTX 6000 Pro 本地跑 DeepSeek 剪视频 — HankYeomans · 2026-09-04
- 推理引擎被指是被忽视的攻击面,模型或可影响解码路径 — JeremyCMorgan · 2026-09-04