GLM 5.3 Flash 本地推理极慢,苹果硅芯片尚无优化
CentrifugalMalaise · reddit · 2026-08-30
用户在 M2 Ultra Mac Pro 上测试了 Unsloth 量化版 GLM 5.3 Flash 模型,发现首 token 生成时间长达 3-4 分钟,几乎无法使用。相比之下,同硬件下运行 Qwen3.5 397B 模型可达 23 tps。用户认为目前的推理引擎尚未解决对 GLM 5.3 Flash 的支持问题,正在寻求是否有在 Apple Silicon 上成功流畅运行的案例。
「Infra」频道最新
- 《Empire of AI》被揪出 4500 倍用水数据错误:升当成立方米 — altryne · 2026-08-30
- 社区分支支持 MiniMax H3 双 GPU 推理与实时预览 — karma3u · 2026-08-30
- 不仅要掌控模型调用,更要掌控模型层本身 — omarsar0 · 2026-08-30
- M4 Max 跑 Qwen3.8-27B:长上下文下 oMLX 胜出,前缀缓存最提速 — vitordeas · 2026-08-30
- 腾讯混元 Hy4-preview 亮相 vLLM:770B MoE 配 1M 上下文 — TencentHunyuan · 2026-08-30
- 「分片就是传输」:青稞 AI 突破 2M 上下文显存瓶颈 — 青稞AI · 2026-08-30