大模型量化方案选择:权重 vs KV Cache
Elorun · reddit · 2026-08-20
用户在需要保持 15k 以上上下文的设置下,权衡两种 Qwen 3.8 27B (llama.cpp) 的量化方案:一种是 Q4KM 权重配合 Q8 KV Cache,另一种是 Q4KXL 权重配合 Q4 KV Cache。用户询问哪种效果更好:是使用更大的权重量化并降低 KV Cache 精度,还是使用较小的权重量化并保持 KV Cache 的高精度?
「Infra」频道最新
- DSCO Router 推出多模型统一网关,支持自带账号自动路由 — arthurcolle · 2026-08-24
- 开源方案 RobotSoul:为 Agent 提供上下文重置后的持久身份 — robauto-dot-ai · 2026-08-24
- 将 MoE 模型卸载至 RAM 运行会遭遇极慢的 Prefill — former_farmer · 2026-08-24
- Etched获10亿美元融资,Jane Street领投验证专用芯片 — TheTuringPost · 2026-08-24
- ConvRot 量化方法入驻 llama-cpp,Q6 接近 Q8 精度 — giveen · 2026-08-24
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24