24GB 显卡塞下 Qwen3.8-27B 编码模型:262k 上下文仍有 40 t/s
W61k3r · reddit · 2026-10-02
社区作者发布了 Qwen3.8-27B CODER 的量化版 GGUF(IQ4XS + imatrix,18.35 GB),经 abliterated 处理后可完整塞进一张 24GB 显卡,并保留约 262k 上下文。MTP draft head 保留 Q80 精度,因此投机解码无需单独的 draft 模型。量化与张量配比由未发布的新版 LexiPanel 自动规划,重要性矩阵基于代码文本构建。
实测数据(RX 7900 XTX + llama.cpp Vulkan 后端,98 个真实 agent 编码请求)非常亮眼:
- 上下文 65k–131k 时解码中位 41.2 t/s,131k–171k 时 36.0 t/s
- MTP draft 接受率中位 85%,约每步 2.7 token
- 冷启动 108k prompt 预填充 387 t/s
- 245k token 上下文时 VRAM 占用 24.2/24.6 GB(q41 KV cache,视觉投影器放 CPU)
作者日常用它做 agent 编码,称其「不像其他微调版那样越写越笨」。帖子给出完整 llama-server 启动命令(含 --spec-type draft-mtp、Qwen 推荐采样参数 temp 1.0 / top-p 0.95 / top-k 20)及 --cache-ram 等 agent 循环优化技巧,24GB 卡用户可直接复现。
「Infra」频道最新
- Agent 应用的成本大头仍是 GPU,并非 CPU 沙箱 — bookwormengr · 2026-10-02
- llama.cpp 新增决策模型端点,单次前向给出选项概率 — ggerganov · 2026-10-02
- 德银首评 FormFactor 买入:Nvidia GPU 探针卡二供,目标价 200 美元 — demian_ai · 2026-10-02
- AI 需求推升内存价格,DRAM 供应持续吃紧 — FinanceYF5 · 2026-10-02
- 黄仁勋答电力约束:每瓦token经济学 favor NVIDIA,80家云伙伴55家在海外 — BenBajarin · 2026-10-02
- llama.cpp 新增 Decision Models,本地推理迎来新玩法 — paf1138 · 2026-10-02