PyTorch MPS 缺 int8 内核拖慢 Mac,开发者补丁搬上 GPU
TomPethtel · reddit · 2026-09-04
PyTorch 的 MPS 后端缺少 aten::intmm 内核,导致 int8 线性层每一次矩阵乘都要绕道 CPU,使 int8 模型在 Mac 上从最快方案变成最慢。作者提交了一个自定义节点补丁,让这些 int8 矩阵乘直接在 Apple Silicon GPU 上计算。对在 Mac 上本地跑量化模型的开发者是实用修复。
「Infra」频道最新
- AI 服务器需求强劲,HPE Q3 超预期并上调 2026 财年展望 — mattwbaker · 2026-09-04
- Chromium 内核浏览器存数据丢失 bug,连 Google 也难修 — uwukko · 2026-09-04
- 数百人抗议苏格兰数据中心热潮,吁暂停至少20个新建项目 — nordicinst · 2026-09-04
- OpenAI、Anthropic、xAI 同日集体宕机,三大模型厂服务同时中断 — pstAsiatech · 2026-09-04
- ChatGPT 宕机时他用双 RTX 6000 Pro 本地跑 DeepSeek 剪视频 — HankYeomans · 2026-09-04
- 推理引擎被指是被忽视的攻击面,模型或可影响解码路径 — JeremyCMorgan · 2026-09-04