GLM CPU纯离线推理遭质疑,实测不足0.2 tok/s

GLM 5.2 Colibri int4 模型此前因宣称能完全在 CPU 上运行、无需 GPU 而受到关注。然而,有开发者在配备 128GB 内存的中端 AMD5 芯片机器上实测发现,其推理速度不到 0.2 tok/s。即使尝试将部分专家转移到 GPU 上运行,速度也没有明显改善。这一实测结果引发了社区对纯 CPU 运行 MoE 模型实际可用性的反讽与质疑。

2026-07-13 ~ 2026-07-13 · 2 条相关