24GB 显卡塞下 256K 上下文:Qwen3.8-27B 混合量化实测 50 tok/s
iam31337 · reddit · 2026-08-18
作者把 Qwen3.8-27B(含内嵌 MTP 层) 连同完整 262,144 token 上下文 塞进 24GB 的 RTX PRO 4000 Blackwell SFF,并保持可用精度与速度:
- 显存:占用 23,952/24,467 MiB(97.9%),填满 261,500 token 后仍剩 515 MiB;F16 视觉投影仪放在第二块 GPU(982 MiB)
- 校准数据:用真实生产历史替代通用语料——296 个 Hermes agent 会话的 5,472 条消息(编码、工具调用、基建、波英双语)
- 张量配方:llama-imatrix 测量 497 个目标权重并作为张量分级图;主体矩阵用原生 NVFP4,敏感的 attention/DeltaNet/FFN 用 Q5K/Q6K,embedding Q6K、输出头 Q80、MTP 层 NVFP4
- 结果:16.3GB GGUF,5.01 BPW;WikiText-2 PPL 6.1197(Q41 为 6.1127,差距 0.11%);现成全 NVFP4 量化 PPL 6.4949,说明全 FP4 对该模型过于激进
- 性能:生产平均 50.44 tok/s;仅目标解码 21.19,MTP 提到 59.46(2.81x);定制 llama.cpp 构建 55.40 vs master 45.42(+21.97%);满 261.5K 上下文时解码降至 12.61 tok/s(带宽受限+16 层全注意力的 KV 读取)
- 反直觉发现:给 MTP drafter 用更高精度反而慢 26.6%——更精确的 drafter 与量化后的目标模型匹配率下降
模型已发布在 HuggingFace,完整张量配方、llama.cpp 补丁、运行参数与失败实验见博客。
「Infra」频道最新
- 16GB 显存跑 Qwen3.8-27B 提速到 20 tok/s 的调优指南 — BassAzayda · 2026-08-18
- Brex 榜单:今年增长最快的初创公司超半数做 AI 基建 — mattturck · 2026-08-18
- Falcata:CUDA原生重写GBDT训练循环,比LightGBM快14倍 — srchvrs · 2026-08-18
- Brex 数据:25 家增长最快厂商中过半卖铲子 — AccBalanced · 2026-08-18
- NVIDIA 优化:本地微调性能提升 20% — danielhanchen · 2026-08-18
- 文本水印检测无需重跑 LLM,仅需低分函数计算 — rasbt · 2026-08-18