8 张 3090 跑 SlimServe:262k 上下文每秒 661 token

QuixiAI · x · 2026-08-27

用户 QuixiAI 分享用 8 张 RTX 3090 搭配 SlimServe 推理服务的实测:Qwen 3.8 Flash Next(Next 预览版)在并发 c1 时约 150 tok/s,c32 并发下最高 661.1 tok/s,同时维持 262k 上下文长度。显示了消费级退役卡集群跑长上下文推理的可行性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →