27B 模型 Q5 量化+131k 上下文塞进单张 24GB 3090,提速 13-17%
bjivanovich · reddit · 2026-10-01
Reddit 用户发布 ATX-Swift-1.5-Qwen3.8-27B-Uncensored-MTP 量化套件(GGUF,i1-Q5KM 为主),在单张 RTX 3090 上实现完整 131072 tokens 上下文、50-65+ t/s 生成速度。
核心问题
- 标准 27B Q5KM 权重约 19.2GB;FP16 KV cache 在 131k 上下文单独就超 24GB
- 社区常规量化对 MTP 草稿块统一压缩,导致推测采样接受率从 85% 跌到约 55%
方案
- 非对称分层量化:MTP 头(blk.64)单独保持 Q80,接受率回升至 76-88%;注意力层 Q6K/Q80 防长上下文推理衰减;FFN 层用 Q5KM
- Turbo KV cache 压缩(-ctk turbo5 -ctv turbo4),把 131k KV cache 压到约 3.8GB,整套模型+上下文全部驻留 24GB 显存(-ngl 99,0 层走内存)
实测(80k-98k 深上下文,对比社区标准 Q5 量化)
- 持续速度 50-54 t/s vs 45 t/s(+13-17%)
- 峰值速度高约 10.7 t/s
- MTP 草稿接受率高 11.5-16.6%
附 HF 模型卡,提供 i1-Q80/Q6K/Q5KM/Q4KM 及多模态 mmproj-BF16 量化。
「Infra」频道最新
- E2B 开源 Embed:单节点部署完整 Agent 沙箱栈 — badphilosopher · 2026-10-01
- 字节Seed研究:分块KV压缩引入相位敏感性,长上下文检索差达40点 — ByteDance-Seed · 2026-10-01
- HPE/博通为 AMD Helios 推 Tomahawk 托盘,单机架配 6 个 — BenBajarin · 2026-10-01
- ASML 光刻机最核心的光源系统竟产自美国圣地亚哥 — Darpinian · 2026-10-01
- agent 全流程优化 PyTorch 任务,PR 已合入六大开源项目最高提速 3.6 倍 — ruilong_li · 2026-10-01
- Starcloud 携手 Firefly 把 H100 送入月球轨道,验证月球数据中心 — ycombinator · 2026-10-01