求助:Beellama 旧缓存降量化方案,对编码质量影响有多大?
RadianceTower · reddit · 2026-09-13
Reddit 用户询问本地推理优化方案 Beellama(及其 fork Beellama-kvarn)的实际质量表现。Beellama 的思路是只对较旧的 KV cache 降量化、保留近期上下文高精度,理论上有望优于对全部缓存统一降量化。官方建议用 1k 的 tail,但作者疑惑为何不能在 240k 上下文上用 20k tail(仍只量化约 220k token)。Beellama-kvarn 据称进一步提升性能,改动正在合并回主线。核心问题:这种做法对(编码)质量到底有多大影响,尚无权威 benchmark。
「Infra」频道最新
- 从 KV 缓存本质讲透 MHA/MQA/GQA/MLA 四种注意力变体的区别 — techNmak · 2026-09-13
- 前 OpenAI 员工:「哪家实验室赢下 AGI」是个过时概念 — GregCook2011 · 2026-09-13
- 实测 Docker 跑 ComfyUI 零性能损失,但默认 /dev/shm 会触发 OOM — fluxdraw · 2026-09-13
- Qwen3.8-27B EXL3 量化版一键部署,16GB 显存就能本地跑 — udmrzn · 2026-09-13
- Nex N2.5 Mini 4bit 跑上 M5 Max:133.6 tok/s,质量速度兼顾 — DerTomsn · 2026-09-13
- Positron 15 个月出货 AI 芯片,Ainek 传 13 个月更快 — DavidBennett__ · 2026-09-13