Apple Silicon推理优化现状:vllm-metal最接近完整栈,mlx-lm仍缺关键优化
McFlurriez · reddit · 2026-08-16
作者花费两周时间调研Apple Silicon上的推理优化,发现软件栈混乱,缺乏像CUDA/NVIDIA那样集成的优化。主要问题包括:Qwen新模型混合KV/循环状态使前缀缓存和投机解码难以结合;mlx-lm转换时丢弃MTP头,导致内置投机解码失效。目前vllm-metal最接近完整优化栈,建议停止重复造轮子,将组件上游到mlx-lm和vllm。
「Infra」频道最新
- Anthropic内部6000亿美元ARR估算引热议:算力需求或占全球70% — rickasaurus · 2026-08-16
- YAOS:基于 Cloudflare Worker 的 Obsidian 零终端实时同步引擎 — tom_doerr · 2026-08-16
- 实测:AMD Venice 芯片在 Agent 沙箱中性能超越 Vera — Sethwinterroth · 2026-08-16
- Quadro RTX 5000 Turing 是否支持 Sage Attention? — mw029297 · 2026-08-16
- 4块RX 6900 XT在Z10PA-U8主板上无法全部识别,求解决方案 — nuclearping · 2026-08-16
- AI算力账单曝光:1GW需投450亿美元,年耗电87TWh — demian_ai · 2026-08-16