llama.cpp更新:Mamba-2预填加速超20%,优化Apple Metal
pmttyji · reddit · 2026-07-28
llama.cpp 近期合并了多项关键性能优化与修复:
- Mamba-2 预填加速:新增分块 SSD 矩阵乘法(#22675),在 Nemotron-Nano-9B-v2 测试中,长上下文(如 8k)预填充速度提升超 20%。
- Apple Metal 优化:为 Metal 后端添加 FWHT kernel(#25924),在 M4 Max 上运行 DeepSeek-V4-Flash 量化模型时,低精度(如 q80)生成速度提升约 3.5%。
- 投机解码:为 GPT-OSS 模型添加了 Eagle3-v3 支持(#25794)。
- Bug 修复:修复了 SYCL 后端 SDPA 缩放问题,并为 Vulkan 重新加入 iq4nl 支持。
「Infra」频道最新
- NVIDIA 称 Jetson 可装进包里,却能驱动机器人和边缘 AI — nordicinst · 2026-07-28
- 印度能在古吉拉特组装成品芯片,但核心仍靠进口 — santoshpanda · 2026-07-28
- 公开竞赛瞄准 Laguna XS 2.1 在 Mac 上再提速 36.8% — gajesh · 2026-07-28
- 先让电力变得充足,AI 丰裕才会到来 — XFreeze · 2026-07-28
- Laguna S 2.1 号称仅为 DeepSeek V4 Pro 的 6% 却更强 — gajesh · 2026-07-28
- Google 似乎把模型蒸馏做成了托管服务 — giveen · 2026-07-28