GLM-5.2量化版在M3 Ultra 512GB本地推理达16 tok/s

antirez · x · 2026-07-06

用户在Apple M3 Ultra 512GB设备上运行GLM-5.2 q4量化模型(ds4-eval版),推理速度约16 token/s。开发者计划更新旧分支以引入批量推理进一步提升性能。这是一次关于智谱GLM系列模型在高端Apple芯片上本地部署性能的实测记录。

所属事件:GLM-5.2量化版在M3 Ultra本地推理达16 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →