24GB 显卡塞下 Qwen3.8-27B 编码模型:262k 上下文仍有 40 t/s

W61k3r · reddit · 2026-10-02

社区作者发布了 Qwen3.8-27B CODER 的量化版 GGUF(IQ4XS + imatrix,18.35 GB),经 abliterated 处理后可完整塞进一张 24GB 显卡,并保留约 262k 上下文。MTP draft head 保留 Q80 精度,因此投机解码无需单独的 draft 模型。量化与张量配比由未发布的新版 LexiPanel 自动规划,重要性矩阵基于代码文本构建。

实测数据(RX 7900 XTX + llama.cpp Vulkan 后端,98 个真实 agent 编码请求)非常亮眼:

作者日常用它做 agent 编码,称其「不像其他微调版那样越写越笨」。帖子给出完整 llama-server 启动命令(含 --spec-type draft-mtp、Qwen 推荐采样参数 temp 1.0 / top-p 0.95 / top-k 20)及 --cache-ram 等 agent 循环优化技巧,24GB 卡用户可直接复现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →