单卡 5090 跑 Qwen3.8-27B:SGLang 全参数调优只换来 82k 上下文
ni1by2thetrue · reddit · 2026-09-15
用户在单张 RTX 5090 上用 SGLang 部署 Qwen3.8-27B(Huihui 去审查 NVFP4 量化多模态版本),贴出完整启动参数求助:启用 253,952 上下文长度、KV cache 用 fp8、静态显存占比 0.97、flashinfer 注意力后端、层级缓存(hicache 写透模式)、Mamba 缓存策略,以及 NEXTN 投机解码(3 步、4 个 draft token)。目前解码速度约 100 tok/s,但实际可用上下文只有约 82k token,远低于 25 万配置值。他想知道如何在保留多模态能力的前提下进一步调参换更长上下文。
「Infra」频道最新
- 把 4 块 MCU 开发板搬上网:AI 写完固件即时上真芯片测试 — SelfishlyWandering · 2026-09-15
- Grouped Value Attention 分组存值按需重建 Key,压缩 KV Cache — Vishesh Tripathi · 2026-09-15
- jinfer 开源:纯 JVM 实现 AI 推理引擎,CPU 性能比肩 llama.cpp — mukel90 · 2026-09-15
- Wan 2.2 显存实测:砍帧数不降 OOM,降分辨率一次省 10GB — Realistic-Fennel-190 · 2026-09-15
- 无状态故障转移丢失近 100% 上下文,ContinuityBench 提出 99.2% 保持率方案 — its_vayishu · 2026-09-15
- 单周 500 万亿 token 将至,引用图示 LLM 用量持续飙升 — gajesh · 2026-09-15