2×5080跑Qwen3.8-Flash-Next:llama.cpp之外要不要换vLLM
whatyathinkk · reddit · 2026-09-17
用户在 2×RTX 5080 + 128GB DDR5 上用 llama.cpp 跑 Qwen3.8-Flash-Next 的 Q5KXL 量化版,配合 MTP 投机解码、MoE 层 CPU 卸载(ncmoe42)等配置,达到约 100 tps prefill、18-20 tps decode。由于 NVFP4/FP8 的 .gguf 文件不多,他想知道换 vLLM/SGLang 能否在该模型上获得更好性能。帖中附完整配置参数。
「Infra」频道最新
- OpenJev 开源:一张 RTX 3090 本地跑 Jev 式语义决策 — alexcovo_eth · 2026-09-17
- 双 7900XTX 跑 MiniMax H3 实测:5 秒视频最低 5 分半,求 N 卡对比 — HopefulConfidence0 · 2026-09-17
- Agent 容错设计:供应商 503 不该决定你是否重复调用工具 — Future_AGI · 2026-09-17
- HDD 一年涨价一倍:Seagate IronWolf Pro 从 550 美元飙至 1100 美元 — HankYeomans · 2026-09-17
- Polymarket:2026年前美国任何州叫停数据中心概率约31% — Polymarket · 2026-09-17
- 数据中心已占弗州Loudoun县地方税收约45% — Polymarket · 2026-09-17