RTX 5090 跑通 Qwen 27B NVFP4:120 t/s 含视觉与 451K 缓存
t4a8945 · reddit · 2026-08-23
分享了在单张 RTX 5090(400W 功耗限制)上运行 Qwen 2.5 27B NVFP4 量化版本的详细配置与性能数据。使用 vLLM 框架,开启了视觉支持和 451K 全局 KV-cache,实现了平均 120 tokens/s 的生成速度。帖子包含详细的性能基准表(从 4K 到 185K 上下文的测试)及完整的环境配置文档链接。
「Infra」频道最新
- 新加坡启用活体人脑细胞服务器,能耗仅为传统 AI 服务器 1% — evilsocket · 2026-08-23
- 构建 AI 生产系统的最佳实践:从推理到部署全流程 — _ScottCondron · 2026-08-23
- Codex 限流致旧方案不可用,Token 真实成本即将显现 — StewartalsopIII · 2026-08-23
- ShardFlow:跨广域网分布式推理 TPS 破 28 — katua_bkl · 2026-08-23
- Cursor 推出基于 S3 的大规模 Git 存储系统 — bibryam · 2026-08-23
- 发布 PromoteOps 工具:多云环境 CloudFormation 推送自动化 — iamthanoss · 2026-08-23