llama.cpp 新 PR 覆盖全部 26 种权重格式,Mac GPU 矩阵乘最高快 4.4 倍
ggerganov · x · 2026-10-08
qvac 团队的 PR #30065 已合并进 llama.cpp:此前的快速 Metal 内核原只覆盖 10 种权重格式,这次补齐了其余 16 种,包括 BF16、MXFP4、Q2K、Q3K 和 IQ 系列量化。
- 少行 MMA 矩阵乘内核扩展到所有带 16 权重反量化器的 src0 类型,还新增 Q10、Q20、TQ20 等
- 在 M3 Ultra(60 核 GPU)上,模型一次校验多个 token 时矩阵乘最高加速 4.4 倍
- 各类型设定了超过当前内核性能的行数阈值(25 行不等),低于阈值沿用原内核
- ggerganov 当天提出、一天内完成合并,受益的是 Mac 上的投机解码速度
「Infra」频道最新
- 爆料:仅一款三星 HBM 满足英伟达 Vera Rubin 性能要求 — zephyr_z9 · 2026-10-08
- Box CEO 论 agent 算力:单个应用服务 1 亿用户需 28 亿美元基建 — inductionheads · 2026-10-08
- 估值近 440 亿美元的数据中心公司 Firmus 澳交所 IPO 告急 — nordicinst · 2026-10-08
- DWDM 波长锁定精度收紧至 ±3.5GHz,OFC 后光互连规格再进化 — jwt0625 · 2026-10-08
- Theo 算账:所谓 1.32 亿美元年 API 成本被夸大 44 倍,一年后或仅千美元 — dotey · 2026-10-08
- SketchSSM 论文:线性注意力解码提速 7.3 倍,状态流量降 10 倍 — sehoonkim418 · 2026-10-08