L40s双卡部署Qwen3.6-35B:实测TP优于PP和DP
gulensah · reddit · 2026-07-29
用户在Proxmox虚拟化环境中使用2张Nvidia L40s(无NVLink)部署Qwen3.6-35B-A3B-FP8模型,对比Tensor Parallelism (TP)、Pipeline Parallelism (PP)和Data Parallelism (DP)的性能。实测结果显示TP在请求数、延迟和吞吐量上均优于PP和DP,与官方文档建议(无NVLink时PP更优)相悖。附详细配置和基准测试数据。
所属事件:双卡 L40S 部署 Qwen 实测:TP 优于 PP(2 条相关)→
「Infra」频道最新
- ML 团队仍靠锁版本保住 torch 和 HF 复现性 — vboykis · 2026-07-29
- 曝黄仁勋向 Ilya 承诺 40 亿美元算力,今年或追加百亿 — iruletheworldmo · 2026-07-29
- AI 实验室正撞上算力瓶颈,下一次跃迁成本更高 — haider1 · 2026-07-29
- 腾讯开源 AngelSpec,推理加速最高可达 2.4 倍 — teortaxesTex · 2026-07-29
- Kimi K3 被指月 API 支出超 2 万美元后更适合自建 — ZeYanjie · 2026-07-29
- AI 需求推高 Bloom 和 Seagate,Vertiv 的广泛组合却承压 — TiernanRayTech · 2026-07-29