单张 5090 如何跑 Qwen3.8-27B:量化与上下文的取舍讨论

DustNearby2848 · reddit · 2026-08-18

Reddit 用户发帖讨论如何在单张 RTX 5090 上托管 Qwen3.8-27B 用于编程:由于该模型推理链很长,需要大上下文,作者尝试过 unsloth/LM Studio 的 Q4 量化、ninfer 的 Q4 和 NVFP4,以及 sglang 的 NVFP4。实测中 ninfer 能提供较大上下文和较高速度,但其 INT8 KV cache 并不理想,目前正在试验中等长度上下文。帖子征集大家在用的推理框架、量化精度与上下文大小。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →