GLM 5.3 Flash 本地推理极慢,苹果硅芯片尚无优化

CentrifugalMalaise · reddit · 2026-08-30

用户在 M2 Ultra Mac Pro 上测试了 Unsloth 量化版 GLM 5.3 Flash 模型,发现首 token 生成时间长达 3-4 分钟,几乎无法使用。相比之下,同硬件下运行 Qwen3.5 397B 模型可达 23 tps。用户认为目前的推理引擎尚未解决对 GLM 5.3 Flash 的支持问题,正在寻求是否有在 Apple Silicon 上成功流畅运行的案例。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →