6 张 V100 跑通 Qwen 3.8 Next:MTP 提速近一倍至 43 tok/s
Odd_Caterpillar_2994 · reddit · 2026-09-20
作者分享了在 6 卡 V100(TP2 PP3)上跑通 Qwen 3.8 Next 的完整过程:
- 踩坑:一块卡掉到 PCIe Gen1 x16,花两天约 8 小时排查;引擎从 sglang-v100(持续 OOM)、pxa(报错)一路试到 1cat-vllm 才稳定运行。
- 配置:TP2 PP3,推测解码只能设 speculative=1,设 2 会 OOM;KV cache 约 8.78 GiB、53 万 token。
- 性能:prefill 在 16K 输入时峰值 4679 tok/s;开启 MTP 后生成速度从平均 22.59 tok/s 提升到 42.70 tok/s,接近翻倍。
- 散热:gpu-burn 压测 20 分钟后温度稳定在 64°C,风扇仅 76% 转速,系统安静稳定。
「Infra」频道最新
- RTX 5090 重装 ComfyUI 实测:316 秒生成 15 秒 MiniMax H3 视频 — tostane · 2026-09-20
- Oracle 新墨西哥数据中心 180 亿美元贷款被降入压力区间 — GaryMarcus · 2026-09-20
- 靠「并行 minibatching」这一冷门技巧,延迟降到原来的 1/10 — unironictechbro · 2026-09-20
- 华为首曝带 HBM 的昇腾 960DT:288GB 显存、4 PFLOPS FP4,2027 年交付 — pstAsiatech · 2026-09-20
- 传 Anthropic 训练算力强度与推理经济性落后于 OpenAI — teortaxesTex · 2026-09-20
- Ben Bajarin:Agent 工作流将催生「Agentic 原生 CPU」新层级 — BenBajarin · 2026-09-20