同款 RTX 5090 推理差百倍:vLLM 官方证实引擎比硬件更关键
vllm_project · x · 2026-10-07
- vLLM 官方账号转评 @NicWAI 的长上下文推理实测:双 RTX 5090 上跑同一模型,vLLM 达到 110 tokens/s,而 llama.cpp 在单张 5090 上长上下文首 token 等了约 30 分钟。
- 同样的硅片,性能差约 100 倍,结论是长上下文 serving 对内存和执行路径的压力极大,serving 引擎架构与 GPU 硬件同样重要。
- 发帖人建议:与其盯着显存规格买卡,不如先对推理软件做基准测试。
「Infra」频道最新
- 英伟达市值逼近 6 万亿美元,官宣史上最大 1500 亿回购 — rohanpaul_ai · 2026-10-07
- 每台电机 7 分钟人工、约 5 美元成本,机器人自动化成唯一出路 — avlok · 2026-10-07
- 铁路建设曾持续占 GDP 1.5-2% 达 60 年,AI 算力扩张今年才追平 — toptickcrypto · 2026-10-07
- vLLM 实测:4:8 稀疏专家 GEMM 比 NVFP4 密集快 1.35-1.65 倍 — vllm_project · 2026-10-07
- kipply 发布七八月双月报:出口管制解除、对齐造假信号等大事复盘 — kipperrii · 2026-10-07
- Marvell 投资者日 2026 材料上线,数据中心 AI 算力布局受关注 — jwt0625 · 2026-10-07