4张5060 Ti 跑 Qwen3.6 实测
joorklee · reddit · 2026-07-12
作者分享了在 **4×5060 Ti(64GB VRAM)P2P** 机器上的推理 benchmark,测试对象是 **Qwen3.6 27B INT8 + bf16 KV cache**,并在 **SGLang** 下跑到较高并发。 结果里最值得看的是: - 成功请求 200 - 并发约 8,峰值并发 11 - 平均 TTFT 约 7.5s,中位约 7.4s - 平均 E2E latency 约 13.7s - 总吞吐约 305 tok/s - 作者特别指出:在这套硬件上,SGLang 比 vLLM 更能扛高并发 帖子还给出了完整启动脚本,包含: - CUDA 与 NCCL 相关环境变量 - 跳过 P2P 检查 - `tp-size 4` - speculative decoding 参数 - qwen3 相关 parser 配置 作者的动机是补充自己之前关于 vLLM 在 TTFT 和并发上的问题,避免别人因此对 4×5060 Ti 路线失去信心。
所属事件:四张5060 Ti本地跑Qwen3.6性价比实测(2 条相关)→
「Infra」频道最新
- OpenRouter 动态路由帮 2.2 万用户节省超 10 万美元 — gajesh · 2026-07-21
- 中国 LLM 厂商 API 价格战持续加剧 — sen_o · 2026-07-21
- Gated Delta Networks 论文把 Mamba 思路推进到新架构 — vista8 · 2026-07-21
- Bindu Reddy 称 Kimi 开源权重太慢,难以规模化使用 — bindureddy · 2026-07-21
- Ramp 开放 AI 模型路由器,内部 LLM 成本降了 30% — welcome_recreation · 2026-07-21
- 开发者做出可断点续跑的 agent swarm 运行时 — Instance_Not_Found · 2026-07-21