单张 AMD R9700 跑 Qwen3.6 35B:vLLM 部署与 INT4 性能实测
KriptacMessage · reddit · 2026-08-08
开发者分享了在单张 AMD Radeon AI Pro R9700 显卡上,使用 vLLM 部署 Qwen3.6 27B 和 35B 模型的优化经验与基准测试结果。
部署配置
- 权重选择:使用 INT4 量化版本(W4A16),因为 35B 模型的 FP8 版本无法完整塞进单张 32GB 显存。
- 参数调整:张量并行设为 1,显存利用率拉升至 0.98。针对 27B 模型开启了推测解码(numspeculativetokens=4),实测该值在各深度下比 8 快 17%-48%。
- 避坑指南:需手动修改 INT4 权重库中 tokenizer.json 的 truncation.maxlength 和 padding,否则会导致视觉功能失效。
性能表现
- 35B MoE 模型:在 4K 上下文时 prefill 速度约 7800 tok/s,decode 约 61 tok/s;在 150K 长文本下仍能保持约 49.5 tok/s 的解码速度。
- 27B Dense 模型:得益于推测解码,4K 上下文时 decode 速度约 59.6 tok/s,平均接受长度达到 4.5。
「Infra」频道最新
- RTX 5090 实测跑 Cosmos3-Nano:FP8/FP4 量化突破 32GB 显存限制 — fengwang_2_718281828 · 2026-08-08
- 解决 MiniMax H3 旧显卡黑屏卡顿:FP16 混合精度修复提速 11 倍 — Bubbly_Lawfulness_43 · 2026-08-08
- 单 CPU 跑百亿大模型:微软开源 1.58 bit 推理框架 BitNet — JafarNajafov · 2026-08-08
- 实测:12GB显存跑MiniMax H3视频生成,超5秒易卡死 — Silver-Spot-2763 · 2026-08-08
- 零月租跑70B大模型:双卡3090本地部署Qwen 2.5全教程 — thisdudelikesAI · 2026-08-08
- engy.ai 上线多款国产开源模型,API 价格大打价格战 — markjeffrey · 2026-08-08