M5 Ultra 跑 LLM 实测:prefill step 设 8192 吞吐提升近 45%

bakawolf123 · reddit · 2026-09-25

帖主给出 M5 Ultra 本地跑 LLM 的调优建议:把 prefill step size 设为 8192。该参数同时影响 prefill 性能和 drafter 获取 MTP logits(影响 dflash,mlx-vlm 需小改以支持 chunked prefill for dflash)。

设置要点:step 要够大以填满所有核心,但不能过大导致多余 dispatch。

实测数据(GLM-flash-4bit + MTP,131k prompt tokens 场景):

生成速度提升约 40%,128k 长上下文总耗时缩短明显;32k 短上下文下收益更大(prompttps 1056 vs 860)。

另注明部分引擎(如 omlx)支持自适应 step size,例如 qwen3.8-flash-next 在 omlx 上从 2048 起步即能达到接近 8k 的性能,小上下文还快 10%,但并非所有引擎如此。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →