llama.cpp 分支合并 Qwen3.8-Flash 支持,5090 上 Q4 量化跑出 44 tks

giveen · reddit · 2026-08-28

开发者 giveen 向 TheTom/llama-cpp-turboquant 提交 PR(#324),从上游 vLLM PR #27742 移植了 qwen4exp(Qwen3.8-Flash-Next) 的支持。实测在 RTX 5090 上以 Q4 量化并启用 --moe-cache auto,达到约 44 tokens/s 的生成速度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →