Mac Studio M5 Ultra 256GB 跑 GLM 5.3 Flash 达 68.8 tok/s
cryotic · reddit · 2026-10-05
网友分享 M5 Ultra 256GB 本地运行 GLM 5.3 Flash 的实测:使用 oQ4e 量化加 MTP(multi-token prediction),在 oMLX 0.7.0 上达到 68.8 tok/s 的解码速度,prefill 速度为 1878 tok/s,并表示还有优化空间。作者称看到其他人的跑分低于预期,故分享自己的成绩供参考。
「Infra」频道最新
- 从先到先得到拍卖:经济学家用 Tullock 竞赛模型推演 OpenRouter 式算力路由演化 — AccBalanced · 2026-10-05
- PyTorch 加速器工作组统一跨后端支持,降低接入门槛 — PyTorch · 2026-10-05
- 数据中心增长停滞:电网、许可与审批卡死多个 AI 数据中心计划 — DavidLinthicum · 2026-10-05
- 开源工具 RemoveMacAI 可删除 macOS 上 12GB Apple Intelligence 数据 — The Verge AI · 2026-10-05
- 4.89MB 权重跑在 5 美元 ESP32-S3 上:ItoTTS 让本地 LLM 开口说话 — Significant-Price695 · 2026-10-05
- 单张 RTX 5090 优化 Qwen3-Omni,首包音频延迟从 213ms 降至 23ms — vllm_project · 2026-10-05