llama.cpp 作者:Qwen3.8-27B 用户可换 DFlash 投机解码再提速
victormustar · x · 2026-10-06
llama.cpp 作者 Georgi Gerganov 宣布:使用 Qwen3.8-27B + MTP 投机解码的用户可升级到新的 DFlash 草稿模式获得更快速度,只需一行命令:llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-dflash --spec-draft-n-max 7,需最新版 llama.cpp v0.6.0。他在引用推中对比了此前的 MTP 配置写法。
「Infra」频道最新
- Marvell 进军定制硅管理方案,瞄准现代计算托盘 BMC 痛点 — BenBajarin · 2026-10-06
- AI 数据中心 2035 年或需 500GW,前英官员警告能源成最大瓶颈 — ShakeelHashim · 2026-10-06
- Starlink 在轨卫星超 1.1 万颗,占全球活跃卫星约三分之二 — XFreeze · 2026-10-06
- Ben Bajarin:Agentic AI 推动数据中心 CPU 需求,关键在 Scale-Up 域设计 — BenBajarin · 2026-10-06
- GLM 5.3 全量 NVFP4 可在 4 张 B200 或 H200 上部署 — TheZachMueller · 2026-10-06
- 网友把 GLM-5.3 无审查版量化成 MXFP4,AMD GPU 可跑 — bakatristan · 2026-10-06