魔改 MLX 把量化权重暂存到 FP8,M6 prefill 提速 40%
Brilliant-Hall1387 · reddit · 2026-10-09
开发者发现 MLX 的量化矩阵乘法(QMM)默认把操作数 dequant 到 FP16,若改为暂存到 FP8,就能用上 Apple Silicon M6 上快 2 倍的 FP8 矩阵路径。
要点:
- 同样思路在 M5 上也有效:把 4-bit affine 权重暂存为 int8 再做 matmul
- 收益集中在 prefill:Qwen3-8B +40%、Qwen3.8-27B +50%;decode 受带宽限制,仍用默认 FP16 暂存更好
- 质量实测:最坏情况困惑度增加约 1% 以内
- FP8 需 M6 + macOS 27 + deployment-target-27 构建;int8 支持 M5 及以后
- 实验性 fork 已开源(fork 于 mlx#4627 之外),博客含完整细节、代码与数据
「Infra」频道最新
- tinygrad 推出新一代 tinybox 主机,可配置、售价 7000 美元起 — HankYeomans · 2026-10-09
- 英伟达宣称 Vera CPU 在百兆瓦数据中心吞吐量超 x86 两倍 — Beth_Kindig · 2026-10-09
- 4 条 PCIe x16 槽位理论可挂 12 张 GPU 并绕过 CPU — TheZachMueller · 2026-10-09
- 开源 Atomic Agent Desktop 发布:本地跑 Qwen/Gemma,云规划+8 个本地 Agent 执行 — testingcatalog · 2026-10-09
- YC 举办推理专题 Paper Club:调优前后延迟成本可差 100 倍 — ycombinator · 2026-10-09
- AI 圈对「边缘计算」最大误解:能「随处运行」不等于「处处都能运行」 — ritakozlov · 2026-10-09