MLX 的 MoE 层提速 1.5 倍,靠 grouped mm 瓦片调度优化

awnihannun · x · 2026-09-28

MLX(苹果开源机器学习框架)合入了一个 Metal 后端优化 PR:重写 gathermm 内核的 tile 分配方式。原实现中 tile 与专家分配相互独立,导致一个线程组要对多个专家做多次 matmul、产生多余的 K 次扫描,对短序列尤其浪费;新方案参考 quack 的 tile scheduler,按行 tile 调度让加载与专家分配对齐,使 MoE 层获得约 1.5 倍加速。对在 Apple Silicon 上本地跑 MoE 模型的用户是直接的推理提速。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →