MTPLX V2发布:Mac端MLX模型推理达82 TPS
YoussofAl · reddit · 2026-07-09
MTPLX V2正式发布,引入了Turbo模式,通过定制的验证专用量化矩阵乘法内核和编译验证步骤,在MacBook Pro M5 Max上运行Qwen 3.6 27b模型时达到了82 TPS的温度0.6推理速度。 此外,新版本还对SSD KV缓存和长上下文工具调用进行了重大改进,并发布了初步的基准对比测试。
所属事件:MTPLX V2发布:Mac本地大模型推理破80 TPS(2 条相关)→
「Infra」频道最新
- Gated Delta Networks 论文把 Mamba 思路推进到新架构 — vista8 · 2026-07-21
- Bindu Reddy 称 Kimi 开源权重太慢,难以规模化使用 — bindureddy · 2026-07-21
- Ramp 开放 AI 模型路由器,内部 LLM 成本降了 30% — welcome_recreation · 2026-07-21
- 开发者做出可断点续跑的 agent swarm 运行时 — Instance_Not_Found · 2026-07-21
- 英国数据中心追逐 AI 增长,冷却用水正成新瓶颈 — nordicinst · 2026-07-21
- Qwen 3.8 Max 与 Kimi K3 领衔,OpenAI 长程失配引关注 — Latent Space · 2026-07-21