MLX-Serve 27B 推理提速:分支猜测一次验证,较上版快 32%
TheMoonMidas · x · 2026-09-27
开发者 ddalcu 介绍 MLX-Serve 的新优化:借鉴 TensorFold 的技巧,对下一个 token 做多个分支猜测并在一次前向中全部验证,从而在 M4 Max 上跑 27B 模型时,生成速度比 TensorFold 快最多 20%,比 26.9.5 版本快 32%。这是苹果 MLX 生态在本地推理吞吐上的又一实用进展。
「Infra」频道最新
- AI agent 提交 PR 太多,CI 成本逼团队从云租用转向自建机房 — peterjliu · 2026-09-28
- 3x3090 换 2x5090:NVFP4+投机解码实测提速明显 — CompetitiveDraft9381 · 2026-09-28
- DeepSeek DSec 论文:单套系统日均 300 万沙箱,每秒创建超 5000 个 — petrusenko_max · 2026-09-28
- llama.cpp 转 vLLM 值不值:新模型 day-0 支持成关键考量 — Exciting-Engine882 · 2026-09-28
- PyTorch 大会将讲企业级 Agent 推理:vLLM 加持 24/7 生产化 — PyTorch · 2026-09-28
- RTX 5070Ti 本地跑 MiniMax H3 视频,9 图参考生成动画 — maciusik · 2026-09-28