GLM-4.5-Air 现已支持 llama.cpp 的 MTP 加速
jacek2023 · reddit · 2026-08-24
用户提醒开发者,旧款模型 GLM-4.5-Air 现在可以通过在 llama.cpp 中启用 MTP (Multi-Token Prediction) 获得显著加速。该模型为 106B MoE 架构,激活参数仅 12B,适合内存大但算力有限的设备(如 3090 显卡)。作者分享了 HF 上的 MTP GGUF 文件下载链接,并推荐了基于该模型的一些创意写作/RP 微调版本。此更新也适用于完整版 GLM-4.5。
「模型」频道最新
- Anthropic 官方回应 Opus 啰嗦:提供配置指令修复 — kimmonismus · 2026-08-24
- Hugging Face 热榜出现 Qwen3.8-27B 去审查版 — orcarouter · 2026-08-24
- SemiAnalysis 实测:200 美元订阅每月最多跑出数千美元 token — scaling01 · 2026-08-24
- 语音 AI 公司 Modulate 登顶 Hugging Face 转写基准 — jonathan_wilke · 2026-08-24
- 质疑 Ox Alpha 夸大宣传,实测未达前沿水平 — peterwildeford · 2026-08-24
- 传闻称 Anthropic 将推 Haiku 5 与 Sonnet 5.1 — ChrisGPT · 2026-08-24