llama.cpp 新 PR 让 Metal 上投机解码提速 3 倍
pmttyji · reddit · 2026-10-06
llama.cpp 的一个 Metal PR 为少行矩阵乘与批量拷贝做了优化,专为 Apple Silicon 上的投机解码(DFlash2)服务。实测 Qwen3.8-27B 配 DFlash2 drafter:代码场景解码从 30.2 tok/s 提升到 110.0 tok/s,散文场景从 16.8 提升到 62.6 tok/s,而在普通串行解码下开销几乎为零。Apple 设备本地跑大模型的用户值得关注。
「Infra」频道最新
- 长文拆解:Nvidia 有护城河但无垄断,Google 自研 TPU 占全球算力近四分之一 — AryHHAry · 2026-10-06
- 4090 跑 Qwen 本地模型,上下文窗口约 32k 就爆显存 — BLUECOW009 · 2026-10-06
- DDR5 超频实测:MoE 模型显存外推理提速最高 14% — EvolvingDior · 2026-10-06
- vLLM 集成 Transformers 后端,文本图像音频视频全模态统一推理 — LysandreJik · 2026-10-06
- 曝 DeepSeek 融资至少 120 亿美元,拟 2027 年初 IPO — teortaxesTex · 2026-10-06
- SEC 文件曝光:Anthropic 5180 亿算力承诺中 80% 不用也得付 — rohanpaul_ai · 2026-10-06