vMLX 推理服务器发布:Apple Silicon 本地部署 OpenAI 兼容 API

tom_doerr · x · 2026-08-15

vMLX 是一个专为 Apple Silicon 设计的自托管推理服务器,支持 LLM、VLM 和图像生成模型。它提供与 OpenAI、Anthropic 和 Ollama 兼容的 HTTP API,无需第三方 API 密钥。该项目引入了 JANG 2-bit 量化技术,据称在 MMLU 测试中得分 74%,远高于 MLX 4-bit 的 26.5%,同时模型体积更小。此外,它还具备原生 MTP 工件检测、混合 SSM 调度器和连续批处理等特性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →