BeeLlama.cpp 新增 KV cache 精度尾段和量化档位

Anbeeld · reddit · 2026-07-27

BeeLlama.cpp v0.4.1 增加了一组针对 llama.cpp 分支的 KV cache 优化,包括:

作者给出了完整基准,重点拿 Qwen 3.6 27B Q5KS 64k 做对比,展示不同 tail 和量化档位在 VRAM 占用 与 KLD/质量 之间的权衡。帖子结论是:在不少配置下,KVarN 能以更低显存接近 q80 的质量,但并不是所有架构都同样适用;例如 Gemma、GPT-OSS 这类 SWA 架构会带来更高的性能与显存代价。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →