llama.cpp 连发三个 Metal MoE 优化 PR,M5 上解码提速 12%
predatar · reddit · 2026-09-03
一位 M5 MacBook Pro 用户为避免本机跑大模型过热,向 llama.cpp 提交了 3 个 Metal 后端优化 PR,并在 Reddit 征集更多机型(尤其 Qwen3.8-Flash-Next)的测试者:
- PR #28301:通用 MoE prefill 优化,跳过未填满 expert tile 中的空工作;附带针对 IQ2/IQ3 量化的反量化优化,对 M5 上的 IQ3XXS 尤其有用
- PR #28302:修复混合/循环模型的 checkpoint 淘汰逻辑,编辑、分支或重开会话时可从最近的 KV/循环状态恢复,避免重新 prefill 大段 prompt
- PR #28086:IQ3XXS Metal 解码优化,在 Tiel-Coder-35B-A3B 负载上解码从 65.6 提到 73.9 tok/s
作者建议用 llama-bench -m model.gguf -p 4096 -n 64 -ub 512 对比 master 与 PR 分支的成绩。
「Infra」频道最新
- 美国 AI 数据中心繁荣背后:业内共知的中国供应链风险 — pstAsiatech · 2026-09-03
- 曝 Nvidia 拟 129 亿美元收购 Hugging Face,约为营收 86 倍 — sanjaykalra · 2026-09-03
- Reka 携英伟达推出实时视频生成模型:720p/24fps 可中途改词 — RekaAILabs · 2026-09-03
- AI 数据中心“ Powered Shell ”股 Q2 财报盘点:走弱归因与反弹催化剂 — BenBajarin · 2026-09-03
- 网友纠正马斯克:新算力相当于而非 500 倍于全地球 — kevinnbass · 2026-09-03
- 摩根大通:超大规模云厂商发债太多,或扰动长端国债供需 — Kr00ney · 2026-09-03