llama.cpp 新 Metal 内核合并,Mac 投机解码提速 3.4 倍至 110 tok/s
ggerganov · x · 2026-10-05
qvac 团队的 PR 被 llama.cpp 作者 ggerganov 亲自审核并合并,为 Apple Silicon 带来新的 Metal 内核,修复了 Mac 上投机解码反而比普通串行解码更慢的问题。
- 背景:投机解码每步验证少量 draft token,batched decoding 每序列一行,导致矩阵乘法只有 216 行;在无 tensor API 的 Apple GPU(M1M4)上,Metal 此前用 mat-vec 内核处理,耗时随行数增长,M3 Ultra 上 Qwen3 27B 的 DFlash2 解码甚至慢于串行解码。
- 方案:新增针对 216 行的 8x8 simdgroup 矩阵 mat-mul 内核,权重对全部行只反量化一次,threadgroup 内 simdgroup 分摊 K 维;Q40、Q80、Q5K 等量化格式有专用内核。
- 效果:M3 Ultra 上投机解码达 110 tok/s,对比普通解码的 32.1 tok/s 提速约 3.4 倍。
「编程与Agent」频道最新
- 曾高调拒绝 MCP 的 Pi 为何改口:官方复盘把 MCP 收进核心的原因 — bibryam · 2026-10-05
- 云上 agent 一句「不到完美别停」,作者 Azure 出口流量被烧掉 450 美元 — pswider · 2026-10-05
- 开源个人 agent Comma 主张「无会话」:任务跨设备、跨会话持续推进 — Tricky_Barnacle_2060 · 2026-10-05
- 91K 星 Agent-Reach 让 AI 代理零 API 费读遍全网,但封号风险自担 — mhdfaran · 2026-10-05
- Claude Opus 全自主做动画视频:下载 Whisper/Kokoro 自己搭管线,花费 16 美元 — yazansr · 2026-10-05
- Postproxy 用 MCP 让小店主在 Claude 里管理 FB、WhatsApp 和 Google 商家页 — danttf · 2026-10-05