BeeLlama.cpp 新增 KV cache 精度尾段和量化档位
Anbeeld · reddit · 2026-07-27
BeeLlama.cpp v0.4.1 增加了一组针对 llama.cpp 分支的 KV cache 优化,包括:
- KVarN:方差归一化的 KV 量化
- KV cache precision tail:把最近一段 token 保持为 BF16/F16,其他部分再量化
- 新的标准 KV cache 类型:q20/q30/q31 和 q60/q61
作者给出了完整基准,重点拿 Qwen 3.6 27B Q5KS 64k 做对比,展示不同 tail 和量化档位在 VRAM 占用 与 KLD/质量 之间的权衡。帖子结论是:在不少配置下,KVarN 能以更低显存接近 q80 的质量,但并不是所有架构都同样适用;例如 Gemma、GPT-OSS 这类 SWA 架构会带来更高的性能与显存代价。
「Infra」频道最新
- Sparrow 标准模式改用 Ministral 3 14B 做本地抽取 — andrejusb · 2026-07-27
- Wistron 在德州投产 7 亿美元工厂,量产 Nvidia GB300 与 Vera Rubin — Beth_Kindig · 2026-07-27
- 本地跑 1 亿 token 的 GLM 5.2 只花 1 美元 — _akhaliq · 2026-07-27
- Cloudflare 的 AI training 拦截可能连 Googlebot 也挡住 — daluoseo · 2026-07-27
- 一个自托管代理把 424 个模型接到同一接口 — ranadheer535 · 2026-07-27
- 长短滑窗注意力让长上下文训练每步快 3 毫秒 — gordic_aleksa · 2026-07-27