SlimServe 让 8 张 3090 跑 Qwen 3.8 Flash Next,解码达 1200 tok/s

QuixiAI · x · 2026-09-06

开源推理项目 SlimServe(基于 ds4/vllm)展示了在 8 张 RTX 3090(开启 P2P)上运行 Qwen 3.8 Flash Next 的推理成绩:批量 C1 解码约 140 tok/s,C32 约 1200 tok/s。作者称在 modest 硬件上实现了「惊人的推理吞吐」,为低成本本地部署提供了参考方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →