SlimServe 让 8 张 3090 跑 Qwen 3.8 Flash Next,解码达 1200 tok/s
QuixiAI · x · 2026-09-06
开源推理项目 SlimServe(基于 ds4/vllm)展示了在 8 张 RTX 3090(开启 P2P)上运行 Qwen 3.8 Flash Next 的推理成绩:批量 C1 解码约 140 tok/s,C32 约 1200 tok/s。作者称在 modest 硬件上实现了「惊人的推理吞吐」,为低成本本地部署提供了参考方案。
「Infra」频道最新
- a16z:数据中心建设支出半年激增超 250 亿美元 — a16z · 2026-09-06
- 马斯克:3D 打印可做复杂流道,但量产太慢太贵不推荐 — i_bioloid · 2026-09-06
- 英伟达指引明年营收增长 70%,产能成唯一上限 — BenBajarin · 2026-09-06
- Unreal Engine 流水线产出 8700+ 小时动作条件视频预训练世界模型 — udmrzn · 2026-09-06
- PyPI 下载量修正冲击多个包统计,数据大幅缩水 — dbreunig · 2026-09-06
- 用户实测本地跑 gemma4:31b-mlx:体验与付费订阅难以区分 — walkingriver · 2026-09-06