单张 R9700 跑 Qwen 27B:3-bit 量化换来 569K token 缓存与 12 倍提速
evp-cloud · reddit · 2026-10-04
一位开发者分享了在单张 AMD Radeon AI PRO R9700(32GB、300W)上本地部署 Qwen3.8 27B 的完整方案:
- 量化策略:并非全模型 3-bit——仅对 MLP、注意力和 Gated DeltaNet 的投影矩阵(24.3B/27B 参数)做 3-bit 量化,每 128 权重一个 scale,实际约 3.1 bit/权重;量化前先做旋转移出离群值,再用约 29.3 万 token 做 GPTQ 校准;embedding、输出头等沿用 MXFP4,生成用 FP8 激活(W3A4)。
- 性能收益:单流解码 179.7 tok/s(比 MXFP4 快 15%),KV 缓存容量翻 2.25 倍,编码模式下可复用前缀缓存达 569,878 token,单请求 262K 上下文且可同时容纳两条满长请求。
- Agent 实测:编码 agent 每轮都重发全部对话,新方案只读新增部分——后期轮次首 token 提前最多 12 倍,整场 agent 会话快约 6 倍;258K 文档二次读取从 134 秒降到 2.7 秒。
- 精度代价:GSM8K、HumanEval 基本持平,MMLU-Pro 子集下降约 2-3 分(知识召回损失)。若在意精度可用同一下载里的一键 MXFP4 模式。
权重、校准数据来源与哈希均已发布在 Hugging Face,3-bit 权重仅 9.55GB 附加下载。
「Infra」频道最新
- Anthropic 310亿美元数据中心落户昆士兰乡村,居民忧环境代价 — nordicinst · 2026-10-04
- 美国数据中心之争或成全球算力落地冲突的预演 — pstAsiatech · 2026-10-04
- RISC-V 芯片加速走向数据中心,美中合作在芯片对抗下持续加深 — pstAsiatech · 2026-10-04
- Thoughtworks 工程师实测四周:本地模型写代码到底行不行 — bibryam · 2026-10-04
- Cloudflare 开源决策模型 Clef:RTX 5090 上单次决策仅 53ms — michellechen · 2026-10-04
- 腾讯拟租 10 万颗芯片,英格兰银行警示 agent 风险 — MirelaXhota · 2026-10-04