Apple Silicon推理优化现状:vllm-metal最接近完整栈,mlx-lm仍缺关键优化

McFlurriez · reddit · 2026-08-16

作者花费两周时间调研Apple Silicon上的推理优化,发现软件栈混乱,缺乏像CUDA/NVIDIA那样集成的优化。主要问题包括:Qwen新模型混合KV/循环状态使前缀缓存和投机解码难以结合;mlx-lm转换时丢弃MTP头,导致内置投机解码失效。目前vllm-metal最接近完整优化栈,建议停止重复造轮子,将组件上游到mlx-lm和vllm。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →