魔改 MLX 把量化权重暂存到 FP8,M6 prefill 提速 40%

Brilliant-Hall1387 · reddit · 2026-10-09

开发者发现 MLX 的量化矩阵乘法(QMM)默认把操作数 dequant 到 FP16,若改为暂存到 FP8,就能用上 Apple Silicon M6 上快 2 倍的 FP8 矩阵路径。

要点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →