BeeLlama.cpp 提升 KV 缓存量化
Anbeeld · reddit · 2026-07-20
BeeLlama.cpp 发布 v0.4.0,重点是围绕 KV cache 的量化与精度控制做了升级,并且用 benchmark 支撑了这些改动。
主要变化包括:
- 引入 KVarN(variance-normalized KV-cache quantization),在同 bit 宽下争取更好的精度/性能平衡;
- 新增 KV cache precision tail,允许最近一段 token 用 BF16/F16 保存,其余 KV 继续量化,减少“关键上下文被压坏”的问题;
- 增加更多标准 KV cache 类型(q60/q61/q20/q21/q30/q31),用于更细粒度的显存取舍;
- 调整 DFlash 的 draft-max 逻辑,并加入 reasoning-loop 保护。
作者还配套写了一篇文章,用 Qwen 3.6 27B 和 Gemma 4 31B 做了 KLD benchmark,说明这些改动对精度和显存的影响。
「Infra」频道最新
- Nothing 手机把电影梗做成了模块化设计玩笑 — ZeYanjie · 2026-07-22
- Actual Computer 称其推理栈已适配英伟达消费级 Blackwell — markjeffrey · 2026-07-22
- Ben Bajarin 称市场仍严重低估 CPU 需求 — BenBajarin · 2026-07-22
- 能源模型称美国或从 2028 年起面临天然气短缺 — churchkey · 2026-07-22
- Arbitrum 模拟显示:ArbOS61 提高 gas 容量,但 L2 收入下降 — tomwanhh · 2026-07-22
- NVIDIA 推 OpenUSD 做仿真与物理 AI 通用底座 — MonaJalal_ · 2026-07-22