GLM CPU纯离线推理遭质疑,实测不足0.2 tok/s
GLM 5.2 Colibri int4 模型此前因宣称能完全在 CPU 上运行、无需 GPU 而受到关注。然而,有开发者在配备 128GB 内存的中端 AMD5 芯片机器上实测发现,其推理速度不到 0.2 tok/s。即使尝试将部分专家转移到 GPU 上运行,速度也没有明显改善。这一实测结果引发了社区对纯 CPU 运行 MoE 模型实际可用性的反讽与质疑。
2026-07-13 ~ 2026-07-13 · 2 条相关
- GLM CPU 宣传遭一句反讽 — DanGrover · 2026-07-13
- AMD5本地推理不到0.2 tok/s — DanGrover · 2026-07-13