GLM-4.5-Air 现已支持 llama.cpp 的 MTP 加速

jacek2023 · reddit · 2026-08-24

用户提醒开发者,旧款模型 GLM-4.5-Air 现在可以通过在 llama.cpp 中启用 MTP (Multi-Token Prediction) 获得显著加速。该模型为 106B MoE 架构,激活参数仅 12B,适合内存大但算力有限的设备(如 3090 显卡)。作者分享了 HF 上的 MTP GGUF 文件下载链接,并推荐了基于该模型的一些创意写作/RP 微调版本。此更新也适用于完整版 GLM-4.5。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →