vMLX 推理服务器发布:Apple Silicon 本地部署 OpenAI 兼容 API
tom_doerr · x · 2026-08-15
vMLX 是一个专为 Apple Silicon 设计的自托管推理服务器,支持 LLM、VLM 和图像生成模型。它提供与 OpenAI、Anthropic 和 Ollama 兼容的 HTTP API,无需第三方 API 密钥。该项目引入了 JANG 2-bit 量化技术,据称在 MMLU 测试中得分 74%,远高于 MLX 4-bit 的 26.5%,同时模型体积更小。此外,它还具备原生 MTP 工件检测、混合 SSM 调度器和连续批处理等特性。
「Infra」频道最新
- ERC-8004 智能体索引报告:36% 存在身份克隆 — GlobalScoreAgent · 2026-08-15
- 研究称 Anthropic 模型总成本或优于开源中国模型 — rohanpaul_ai · 2026-08-15
- Polygres 将 Postgres 变为 Agent 扩展上下文 — Scobleizer · 2026-08-15
- vLLM 推出自适应验证,DSpark 推理性能优化 — vllm_project · 2026-08-15
- 开源追赶闭源:质量差距仅剩数月 — togethercompute · 2026-08-15
- Valar 核能创始人谈核能如何解锁能源无限 — No Priors · 2026-08-15