SlimServe 开源:4 张 A100 跑 DeepSeek 并发吞吐量破千
QuixiAI · x · 2026-08-11
QuixiAI 在 GitHub 上开源了 SlimServe 推理服务框架,并展示了其出色的并发处理能力。
在 4 张 A100 GPU 上运行 DeepSeek v4 Flash 0731 模型时,性能表现如下:
- 单请求延迟:175 tokens/s
- 64 并发请求吞吐量:1000 tokens/s
该框架旨在提供高效的 LLM 部署方案。
「Infra」频道最新
- 仅花200美元从零训练1B参数大模型,作者全开源训练细节 — SevereTilt · 2026-08-11
- AI网关与模型路由需求激增,成行业新热点 — shensi · 2026-08-11
- OpenAI 致信德州州长,阐述负责任 AI 基础设施建设愿景 — borowcy · 2026-08-11
- 实测 DGX Spark 运行 H3:ComfyUI 文生视频初探 — allaboutai-kris · 2026-08-11
- 中国首款国产前道光刻机投产,性能对标 90 年代 ASML — pstAsiatech · 2026-08-11
- 不足10%企业规模化落地AI,算力短缺将长期制约 — BenBajarin · 2026-08-11