求助:Beellama 旧缓存降量化方案,对编码质量影响有多大?

RadianceTower · reddit · 2026-09-13

Reddit 用户询问本地推理优化方案 Beellama(及其 fork Beellama-kvarn)的实际质量表现。Beellama 的思路是只对较旧的 KV cache 降量化、保留近期上下文高精度,理论上有望优于对全部缓存统一降量化。官方建议用 1k 的 tail,但作者疑惑为何不能在 240k 上下文上用 20k tail(仍只量化约 220k token)。Beellama-kvarn 据称进一步提升性能,改动正在合并回主线。核心问题:这种做法对(编码)质量到底有多大影响,尚无权威 benchmark。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →