实测 MLX 推理:M2 Max 端侧仍达 514 tok/s

MaziyarPanahi · x · 2026-07-04

针对"729 tok/s 是否真实"的疑问,作者实测了四个 v2 MLX 构建版本:同一临床语料、单流、batch 1、解码开销计入。结果显示 8-bit 在两款模型上都快于 fp16,因此 demo 采用 8-bit;一台普通 M2 Max 笔记本完全端侧也能跑出 514 tok/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →