4张5060 Ti 跑 Qwen3.6 实测
joorklee · reddit · 2026-07-12
作者分享了在 4×5060 Ti(64GB VRAM)P2P 机器上的推理 benchmark,测试对象是 Qwen3.6 27B INT8 + bf16 KV cache,并在 SGLang 下跑到较高并发。
结果里最值得看的是:
- 成功请求 200
- 并发约 8,峰值并发 11
- 平均 TTFT 约 7.5s,中位约 7.4s
- 平均 E2E latency 约 13.7s
- 总吞吐约 305 tok/s
- 作者特别指出:在这套硬件上,SGLang 比 vLLM 更能扛高并发
帖子还给出了完整启动脚本,包含:
- CUDA 与 NCCL 相关环境变量
- 跳过 P2P 检查
- tp-size 4
- speculative decoding 参数
- qwen3 相关 parser 配置
作者的动机是补充自己之前关于 vLLM 在 TTFT 和并发上的问题,避免别人因此对 4×5060 Ti 路线失去信心。
所属事件:四张5060 Ti本地跑Qwen3.6性价比实测(2 条相关)→
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11