单卡 5090 跑 Qwen3.8-27B:SGLang 全参数调优只换来 82k 上下文

ni1by2thetrue · reddit · 2026-09-15

用户在单张 RTX 5090 上用 SGLang 部署 Qwen3.8-27B(Huihui 去审查 NVFP4 量化多模态版本),贴出完整启动参数求助:启用 253,952 上下文长度、KV cache 用 fp8、静态显存占比 0.97、flashinfer 注意力后端、层级缓存(hicache 写透模式)、Mamba 缓存策略,以及 NEXTN 投机解码(3 步、4 个 draft token)。目前解码速度约 100 tok/s,但实际可用上下文只有约 82k token,远低于 25 万配置值。他想知道如何在保留多模态能力的前提下进一步调参换更长上下文。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →