MLX 的 MoE 层提速 1.5 倍,靠 grouped mm 瓦片调度优化
awnihannun · x · 2026-09-28
MLX(苹果开源机器学习框架)合入了一个 Metal 后端优化 PR:重写 gathermm 内核的 tile 分配方式。原实现中 tile 与专家分配相互独立,导致一个线程组要对多个专家做多次 matmul、产生多余的 K 次扫描,对短序列尤其浪费;新方案参考 quack 的 tile scheduler,按行 tile 调度让加载与专家分配对齐,使 MoE 层获得约 1.5 倍加速。对在 Apple Silicon 上本地跑 MoE 模型的用户是直接的推理提速。
「Infra」频道最新
- H-Company 用 NVIDIA Dynamo 优化计算机操作 Agent 的 VLM 推理 — NVIDIA Developer · 2026-09-28
- PyTorch Lightning 携手 Google Cloud,checkpoint 写入提速最高 95% — LightningAI · 2026-09-28
- Crucible Capital 创始人以稳定币债务加个人信用加杠杆自建 GPU 集群 — MarvinTBaumann · 2026-09-28
- NVIDIA 发布 Open Agent Safety 平台:权限管控加基础设施级监控 — nvidia · 2026-09-28
- Cloudflare 多租户存储事故:删除卷未清零,24 个容器中 18 个残留他人数据 — arpit_bhayani · 2026-09-28
- RTX 5090 本地编码模型怎么选:Qwen 27B 200TPS 与 Flash 50TPS 之间找平衡 — MasterNomie · 2026-09-28