antirez 移植 GLM 5.2 Flash 模型,M5 Max 可流畅运行

antirez · x · 2026-08-28

Redis 作者 antirez 发布了 GLM 5.2 Flash 的 Q2 和 Q4 量化版本。该模型参照 DwarfStar GGUF 的 DS4 Flash 配方制作,已验证可在配备 128GB 内存的 M5 Max 上运行,且 Q4 权重支持双 M5 Max 系统的张量并行推理。目前仍在测试 CUDA 和 ROCm 支持,代码即将上传至 GitHub。

所属事件:antirez 移植 GLM 5.2 Flash,M5 Max 可本地运行(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →