PyTorch MPS 缺 int8 内核拖慢 Mac,开发者补丁搬上 GPU

TomPethtel · reddit · 2026-09-04

PyTorch 的 MPS 后端缺少 aten::intmm 内核,导致 int8 线性层每一次矩阵乘都要绕道 CPU,使 int8 模型在 Mac 上从最快方案变成最慢。作者提交了一个自定义节点补丁,让这些 int8 矩阵乘直接在 Apple Silicon GPU 上计算。对在 Mac 上本地跑量化模型的开发者是实用修复。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →