实测 MLX 推理:M2 Max 端侧仍达 514 tok/s
MaziyarPanahi · x · 2026-07-04
针对"729 tok/s 是否真实"的疑问,作者实测了四个 v2 MLX 构建版本:同一临床语料、单流、batch 1、解码开销计入。结果显示 8-bit 在两款模型上都快于 fp16,因此 demo 采用 8-bit;一台普通 M2 Max 笔记本完全端侧也能跑出 514 tok/s。
「Infra」频道最新
- 8 美元 ESP32-S3 竟能离线跑 2890 万参数模型 — yangyi · 2026-07-27
- YC 演讲谈 BCI × AI:真正决定速度的是基础设施 — garrytan · 2026-07-27
- 13B 模型靠 SSD 分页在无独显电脑上离线跑通 — ID_R_McGregor · 2026-07-27
- llama.cpp 提醒:旧版 GGUF 在新改动后必须重生成 — EconomySerious · 2026-07-27
- 5090 本地测试:80k 上下文下 Qwen Q6 速度掉到 15 tok/s — LFAdvice7984 · 2026-07-27
- Ubuntu 部署惊艳实测:5090 显卡成最易配置的 AI 设备 — _xjdr · 2026-07-27