GLM-5.2量化版在M3 Ultra本地推理达16 tok/s

智谱GLM-5.2的4bit量化版本在搭载512GB内存的苹果M3 Ultra设备上,实现了约16 tokens/秒的本地推理速度。这一实测表现证明了大型模型在顶级消费级硬件上流畅运行的可行性,开发者后续还计划引入批量推理以进一步提升性能。

2026-07-05 ~ 2026-07-06 · 2 条相关