llama.cpp 合入 PR 为 Qwen Flash Next 添加 MTP 支持,量化已上架

jacek2023 · reddit · 2026-10-01

GitHub 用户 am17an 向 ggml-org/llama.cpp 提交并合入了 Qwen4Exp PR(#29761),为 Qwen Flash Next 添加 MTP(多 token 预测)支持,本地推理速度可进一步提升。配套的 GGUF 量化版本已发布在 Hugging Face(ggml-org/Qwen3.8-Flash-Next-GGUF),作者戏称是从 Qwen 3.8 27B 换机的时机到了。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →