8 张 3090 跑 SlimServe:262k 上下文每秒 661 token
QuixiAI · x · 2026-08-27
用户 QuixiAI 分享用 8 张 RTX 3090 搭配 SlimServe 推理服务的实测:Qwen 3.8 Flash Next(Next 预览版)在并发 c1 时约 150 tok/s,c32 并发下最高 661.1 tok/s,同时维持 262k 上下文长度。显示了消费级退役卡集群跑长上下文推理的可行性。
「Infra」频道最新
- ik_llama.cpp 本月更新:新增 DSpark 推测解码与多项优化 — pmttyji · 2026-08-27
- 实测:OX Alpha WebGPU 运行成本仅 0.016 美元 — yuwen_lu_ · 2026-08-27
- 本地 AI 显存足但速度慢?96GB 混插内存实战分析 — QuirksNFeatures · 2026-08-27
- PyTorch 生态新增 Perforated 等 10 个项目 — zhyncs42 · 2026-08-27
- Jalapeño 芯片能效超竞品 1.9 倍,吐槽文档晦涩 — Artistic_Phone9367 · 2026-08-27
- OpenAI 内部妥协风险或被低估,基础设施是关键 — sjgadler · 2026-08-27