vLLM 本地跑 Qwen3.8-27B-NVFP4 撑起 1M 上下文,完整配置公开
No_Night679 · reddit · 2026-09-16
一位自称初学者的作者分享了用 vLLM 在本机(原生部署、非容器)跑通 unsloth/Qwen3.8-27B-NVFP4、并把上下文长度拉到 100 万 token 的完整 systemd 配置。
关键配置要点:
- 4 卡张量并行(tensor-parallel-size 4),gpu-memory-utilization 0.91
- KV cache 用 fp8 省显存,启用 MTP 投机解码(3 个投机 token)加速
- 通过 hf-overrides 注入 yarn RoPE 参数(ropetheta 1e7、factor 4.0)扩展到 1M 上下文,需配合 VLLMALLOWLONGMAXMODELLEN=1
- 启用 qwen3 reasoning parser 与 qwen3xml tool-call parser,支持自动工具调用
作者表示跑起来后效果不错(so far so good),但不确定配置是否最优、还有没有可调空间,欢迎指正。对想在本地方案上挑战超长上下文的开发者是一份可直接照抄的起点配置。
「Infra」频道最新
- 开发者吐槽 Agent 沙盒定价:常驻成本是 6 美元/月 VPS 的 20 倍以上 — Aryvyo · 2026-09-16
- NVIDIA Vera CPU实测:Agent工作负载单核性能达x86竞品1.64倍 — ryanshrout · 2026-09-16
- 麦肯锡:2030 年主权 AI 市场规模将达 5000-6000 亿美元 — Beth_Kindig · 2026-09-16
- Intel CEO 陈立武现身 AI Infra Summit,喊话「拥抱 AI 而非恐惧」 — karlfreund · 2026-09-16
- Brad Gerstner:AI 交易需要营收维持陡峭增长,扩建才能继续 — markjeffrey · 2026-09-16
- 传英伟达新硬件同功耗下吞吐量提升 40% — karlfreund · 2026-09-16