M5 Ultra 跑 LLM 实测:prefill step 设 8192 吞吐提升近 45%
bakawolf123 · reddit · 2026-09-25
帖主给出 M5 Ultra 本地跑 LLM 的调优建议:把 prefill step size 设为 8192。该参数同时影响 prefill 性能和 drafter 获取 MTP logits(影响 dflash,mlx-vlm 需小改以支持 chunked prefill for dflash)。
设置要点:step 要够大以填满所有核心,但不能过大导致多余 dispatch。
实测数据(GLM-flash-4bit + MTP,131k prompt tokens 场景):
- step 8192:prompttps 735.5,generationtps 71.1,总耗时 185.4s
- step 2048:prompttps 623.6,generationtps 50.8,总耗时 220.3s
生成速度提升约 40%,128k 长上下文总耗时缩短明显;32k 短上下文下收益更大(prompttps 1056 vs 860)。
另注明部分引擎(如 omlx)支持自适应 step size,例如 qwen3.8-flash-next 在 omlx 上从 2048 起步即能达到接近 8k 的性能,小上下文还快 10%,但并非所有引擎如此。
「Infra」频道最新
- 从 KV Cache 到多智能体:一份循序渐进的 AI 系统设计开源指南 — blaizedsouza · 2026-09-25
- Yoav Goldberg 谈推理工程师真功夫:KV 缓存、通信、负载均衡才算入门 — yoavgo · 2026-09-25
- 数据中心噪音真凶是风扇低频:dBA 标准漏测了 73 Hz 嗡鸣 — CurieuxExplorer · 2026-09-25
- 10mm 超广角实拍跑 3DGS,作者吐槽 LichtFeld 默认暗角问题 — janusch_patas · 2026-09-25
- Brookings 估算美国 AI 基建至 2032 达 10.3 万亿美元,占 GDP 3.6% — emmanuelvivier · 2026-09-25
- Anthropic 与 Akamai 达成 120 亿美元 AI 算力协议 — CodeByPoonam · 2026-09-25