llama.cpp 作者:Qwen3.8-27B 用户可换 DFlash 投机解码再提速

victormustar · x · 2026-10-06

llama.cpp 作者 Georgi Gerganov 宣布:使用 Qwen3.8-27B + MTP 投机解码的用户可升级到新的 DFlash 草稿模式获得更快速度,只需一行命令:llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-dflash --spec-draft-n-max 7,需最新版 llama.cpp v0.6.0。他在引用推中对比了此前的 MTP 配置写法。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →