llama.cpp 优化:Metal 后端提速 12.7%
predatar · reddit · 2026-09-01
作者提交了一个针对 llama.cpp 的 Metal 后端优化 PR,旨在提升 Apple Silicon 上 IQ3XXS 模型的解码速度。在测试工作负载中,TieL Coder 35B A3B 模型的解码速度从 65.6 tok/s 提升至 73.9 tok/s。作者邀请社区测试并分享对比数据,并预告后续将有针对 prefill 阶段的优化。
「Infra」频道最新
- LITE 推 VCSEL 用于 AI 扩展互连,产品延后 — zephyr_z9 · 2026-09-01
- 英伟达财报:避免算力垄断与每千瓦时美元价值 — Stratechery · 2026-09-01
- 英国三校联合发布 TEASBench:跨硬件测 AI 推理成本与性能 — PontiEdoardo · 2026-09-01
- TEAS 基准:按数据集自然长度测推理,报告成本与能耗 — PontiEdoardo · 2026-09-01
- TEAS 基准:9 种加速器跑 6 类真实 Agent 负载 — PontiEdoardo · 2026-09-01
- Nebius 高管谈 AI 算力瓶颈与推理需求爆发 — demian_ai · 2026-09-01