2×5080跑Qwen3.8-Flash-Next:llama.cpp之外要不要换vLLM

whatyathinkk · reddit · 2026-09-17

用户在 2×RTX 5080 + 128GB DDR5 上用 llama.cpp 跑 Qwen3.8-Flash-Next 的 Q5KXL 量化版,配合 MTP 投机解码、MoE 层 CPU 卸载(ncmoe42)等配置,达到约 100 tps prefill、18-20 tps decode。由于 NVFP4/FP8 的 .gguf 文件不多,他想知道换 vLLM/SGLang 能否在该模型上获得更好性能。帖中附完整配置参数。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →