32GB 显存跑 Qwen3.8 27B:动态配置让上下文从 17 万扩到 26 万 token

wadeAlexC · reddit · 2026-09-12

Reddit 用户 wadeAlexC 不满 kv cache 量化损失质量,开发了开源工具 llama-manager,作为 llama.cpp 分支的包装层,支持模型加载后动态修改配置:开关投机解码、迁移 mmproj 到 CPU、动态量化 kv cache,且重配置期间保留已有 kv cache、无需重新 prompt 处理,甚至可在生成中途热更新。

工作方式:当请求因触顶上下文上限失败时,工具不暂停生成,按可配置顺序逐级应用扩容策略。以 Qwen3.8-27B-UD-Q4KXL 在 32GB GPU 上的实测为例:

核心思路是:大部分推理并不发生在上下文上限处,静态提前量化 kv cache 会白白损失质量;只在真正逼近上限时才逐级妥协,能最大化保持输出质量。项目开源于 GitHub(wadealexc/llama-manager),README 说明了所需 llama.cpp 分支的改动与新增 HTTP 端点。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →