单卡 RTX 5090 实测:27B 模型 616 tok/s 跑通 262K 上下文
EAccelerate_42 · x · 2026-08-26
- 核心配置:单张 RTX 5090 (32GB, Blackwell 架构) 运行 Qwen2.5-27B 模型。
- 极致性能:使用 NVFP4 权重、KV Cache 和 DFlash2 (K=7) 推测解码技术,在 262K 上下文长度下实现 616 tok/s 的聚合吞吐量(4 路并发)。
- 技术细节:项目提供了 vLLM v0.27.1 的补丁、Dockerfile 和完整的构建脚本,支持 Tool calling 和可选的 CPU 视觉侧载。
- 可用性:作者提供了两条命令即可部署的流程,并附上了详细的基准测试证据。
「Infra」频道最新
- 西班牙拟收紧数据中心监管:水电及安全标准升级 — Polymarket · 2026-08-26
- TorchMorph:PyTorch 生态的 CUDA 加速形态学库 — kornia_foss · 2026-08-26
- Shopify CEO 开源无数据库 Git 服务器:S3 即仓库 — Shruti_0810 · 2026-08-26
- Jalapeno 芯片表现强劲,揭示 Nvidia 架构推理劣势 — beffjezos · 2026-08-26
- 澳大利亚总理让步:AI 数据中心不再强制全用绿电供电 — nordicinst · 2026-08-26
- 16GB显存跑27B:OpenCode+Qwen3.8本地编码完整配置教程 — Due-Project-7507 · 2026-08-26