RTX 6000 Pro 跑 Qwen3.8-27B 达 223 tok/s
BanghuaZ · x · 2026-08-17
该项目提供了在 NVIDIA RTX 6000 Pro (96GB) 上运行 Qwen3.8-27B 的 SGLang 脚本。通过使用 NVFP4 权重和 DSpark 推测解码,单流吞吐量可达 200-223 tok/s,并支持原生 256k 上下文窗口和 8 个并发请求。方案默认使用 FP8 KV cache 以优化显存占用。
「Infra」频道最新
- 2026系统设计指南:掌握这10个核心概念 — blaizedsouza · 2026-08-17
- AI经济学类比:全AI服务器揭示算力与电力成新瓶颈 — demian_ai · 2026-08-17
- 构建Agent生产级服务层:连接池与熔断实践 — blaizedsouza · 2026-08-17
- 专家担忧嵌入式设备难升级成 AI 安全短板 — johnowhitaker · 2026-08-17
- 求助:将 Qwen3.8 27B 转换为 ONNX 格式以适配 NPU — xXDennisXx3000 · 2026-08-17
- Gonka 推出 1M 上下文 V4-Flash 分布式推理 — autoimago · 2026-08-17