MTPLX V2发布:Mac端MLX模型推理达82 TPS

YoussofAl · reddit · 2026-07-09

MTPLX V2正式发布,引入了Turbo模式,通过定制的验证专用量化矩阵乘法内核和编译验证步骤,在MacBook Pro M5 Max上运行Qwen 3.6 27b模型时达到了82 TPS的温度0.6推理速度。 此外,新版本还对SSD KV缓存和长上下文工具调用进行了重大改进,并发布了初步的基准对比测试。

所属事件:MTPLX V2发布:Mac本地大模型推理破80 TPS(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →