实测 M1 Pro 跑 Qwen 3.8:256k 上下文仍可达 45 tok/s

EyalToledano · x · 2026-09-02

Eyal Toledano 分享了在 M1 Pro (64GB RAM) 上运行 Qwen 3.8-Flash-Next 的实测数据。在 0.75x RAM 限制下,Q4 量化、32k 上下文时可达 38 tok/s 爆发速度,4 个 Agent 聚合吞吐量为 51 tok/s。即使在 256k 长上下文下,通过调整参数(Q3 量化),仍能维持 18 tok/s 的持续速度和 57 tok/s 的聚合吞吐量。

所属事件:Qwen3.8-Flash-Next 搭载 pMLX 引擎:小显存跑大模型(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →