SGLang 比 vLLM 多占 18.5GB 显存:混合注意力模型实测存疑
SomeRandomGuuuuuuy · reddit · 2026-08-18
Reddit 用户在 RTX PRO 6000 Blackwell(97GB)上用相同配置对比 vLLM v0.27.1 与 SGLang 0.5.17 跑 Qwen/Qwen3.8-27B(BF16,TP=1,256K 上下文,mem fraction 0.8,128 并发),发现巨大差异:
- SGLang 为 128 个请求槽位预留了 18.49 GB 的 recurrent GDN state,KV cache 只剩约 74,460 个 token
- vLLM 在同等内存比例下可用 KV token 达 356,764,约为 SGLang 的 4.8 倍
该模型为混合注意力架构:64 层中 16 层为 full attention,48 层为线性注意力/GDN 层(4 个 KV head,headdim 256)。作者已尽量对齐两边参数(chunked prefill、cudagraph、关闭 prefix cache 等),仍无法解释差距,不确定是 SGLang 的预期行为还是配置问题,并回忆半年前就见过类似现象。
「Infra」频道最新
- Modular 年度最大发布:ModCon 2026 主旨演讲定档 — clattner_llvm · 2026-08-18
- Qwen3.8-27B 去审查量化版发布,FastMTP 推理提速最高 3.02 倍 — hauhau901 · 2026-08-18
- 摩根大通预测2026年AI加速器出货涨62%至1630万 — Beth_Kindig · 2026-08-18
- Ollama 测评:DeepSeek V4 Flash 性能最佳,Qwen 质优但慢 30 倍 — ollama · 2026-08-18
- 2026 智能体爆发推高前沿模型毛利率至 85% — ben_j_todd · 2026-08-18
- Bittensor 联创谈去中心化 AI:像挖比特币一样「挖智能」 — markjeffrey · 2026-08-18