双 L40S 跑 Qwen3.6-35B,TP 竟比 PP 更快
amiitk · reddit · 2026-07-29
一位 Reddit 用户在 Proxmox 虚拟机里把两张 Nvidia L40S 直通给 Ubuntu,测试 Qwen/Qwen3.6-35B-A3B-FP8 在 TP / DP / PP 三种并行方式下的表现,结果却是 Tensor Parallelism(TP)明显优于 Pipeline Parallelism(PP)。
实验配置
- 双 L40S,没有 NVLink,PCIe 4 x16
- 容器镜像:vllm/vllm-openai:latest
- 压测:GuideLLM sweep,512 输入 tokens / 128 输出 tokens,持续 60 秒,rate=8
- 作者还贴出了 TP / DP / PP 的完整启动参数
结果对比
- TP=2:58 次成功请求,平均延迟 10.518s,每输出 token 82.171ms,吞吐 0.95 req/s
- PP=2:44 次成功请求,平均延迟 13.928s,每输出 token 108.815ms,吞吐 0.7167 req/s
作者怀疑自己是不是漏了什么调优项,或者当前基准测试并不适合体现 PP/DP 的优势。
所属事件:双卡 L40S 部署 Qwen 实测:TP 优于 PP(2 条相关)→
「Infra」频道最新
- SK 海力士疑似在 Kioxia 股价大涨后清仓剩余持股 — firstadopter · 2026-07-29
- 64GB 内存配 5070 Ti,跑 AI 该买 DRAM NVMe 还是继续加内存 — earthsaver77 · 2026-07-29
- Haskell 线程称:重度 agentic coding 用 400 小时约等于一次往返航班 — tomjaguarpaw · 2026-07-29
- 阿里和华为同步支持 Kimi K3 的 SuperNode 部署 — pstAsiatech · 2026-07-29
- OceanBase 首次外部融资启动,年化收入已超 14 亿元 — 智东西 · 2026-07-29
- RTX 5090 已卖到 4 万克朗加税,GPU 价格再冲高 — wandedob · 2026-07-29