antirez 移植 GLM 5.2 Flash 模型,M5 Max 可流畅运行
antirez · x · 2026-08-28
Redis 作者 antirez 发布了 GLM 5.2 Flash 的 Q2 和 Q4 量化版本。该模型参照 DwarfStar GGUF 的 DS4 Flash 配方制作,已验证可在配备 128GB 内存的 M5 Max 上运行,且 Q4 权重支持双 M5 Max 系统的张量并行推理。目前仍在测试 CUDA 和 ROCm 支持,代码即将上传至 GitHub。
所属事件:antirez 移植 GLM 5.2 Flash,M5 Max 可本地运行(2 条相关)→
「Infra」频道最新
- AISI 开源 optstop 工具,降低大模型评测 Token 消耗 — HZoete · 2026-08-28
- 英伟达预测下一财年收入增长约 70%,AI 算力需求持续飙升 — Polymarket · 2026-08-28
- GPU 繁荣下的隐忧:科技公司的循环需求催生泡沫? — DavidLinthicum · 2026-08-28
- 工程探讨:如何优化 DeepSeek Harness 的上下文压缩策略? — shady101852 · 2026-08-28
- NVIDIA Vera 芯片规模出货,为 AI Agent 优化 CPU 瓶颈 — rohanpaul_ai · 2026-08-28
- llama.cpp 分支合并 Qwen3.8-Flash 支持,5090 上 Q4 量化跑出 44 tks — giveen · 2026-08-28