BeeLlama.cpp 提升 KV 缓存量化
Anbeeld · reddit · 2026-07-20
BeeLlama.cpp 发布 v0.4.0,重点是围绕 KV cache 的量化与精度控制做了升级,并且用 benchmark 支撑了这些改动。
主要变化包括:
- 引入 KVarN(variance-normalized KV-cache quantization),在同 bit 宽下争取更好的精度/性能平衡;
- 新增 KV cache precision tail,允许最近一段 token 用 BF16/F16 保存,其余 KV 继续量化,减少“关键上下文被压坏”的问题;
- 增加更多标准 KV cache 类型(q60/q61/q20/q21/q30/q31),用于更细粒度的显存取舍;
- 调整 DFlash 的 draft-max 逻辑,并加入 reasoning-loop 保护。
作者还配套写了一篇文章,用 Qwen 3.6 27B 和 Gemma 4 31B 做了 KLD benchmark,说明这些改动对精度和显存的影响。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11