大模型量化方案选择:权重 vs KV Cache

Elorun · reddit · 2026-08-20

用户在需要保持 15k 以上上下文的设置下,权衡两种 Qwen 3.8 27B (llama.cpp) 的量化方案:一种是 Q4KM 权重配合 Q8 KV Cache,另一种是 Q4KXL 权重配合 Q4 KV Cache。用户询问哪种效果更好:是使用更大的权重量化并降低 KV Cache 精度,还是使用较小的权重量化并保持 KV Cache 的高精度?

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →