4张5060 Ti 跑 Qwen3.6 实测

joorklee · reddit · 2026-07-12

作者分享了在 **4×5060 Ti(64GB VRAM)P2P** 机器上的推理 benchmark,测试对象是 **Qwen3.6 27B INT8 + bf16 KV cache**,并在 **SGLang** 下跑到较高并发。 结果里最值得看的是: - 成功请求 200 - 并发约 8,峰值并发 11 - 平均 TTFT 约 7.5s,中位约 7.4s - 平均 E2E latency 约 13.7s - 总吞吐约 305 tok/s - 作者特别指出:在这套硬件上,SGLang 比 vLLM 更能扛高并发 帖子还给出了完整启动脚本,包含: - CUDA 与 NCCL 相关环境变量 - 跳过 P2P 检查 - `tp-size 4` - speculative decoding 参数 - qwen3 相关 parser 配置 作者的动机是补充自己之前关于 vLLM 在 TTFT 和并发上的问题,避免别人因此对 4×5060 Ti 路线失去信心。

所属事件:四张5060 Ti本地跑Qwen3.6性价比实测(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →