实测 M1 Pro 跑 Qwen 3.8:256k 上下文仍可达 45 tok/s
EyalToledano · x · 2026-09-02
Eyal Toledano 分享了在 M1 Pro (64GB RAM) 上运行 Qwen 3.8-Flash-Next 的实测数据。在 0.75x RAM 限制下,Q4 量化、32k 上下文时可达 38 tok/s 爆发速度,4 个 Agent 聚合吞吐量为 51 tok/s。即使在 256k 长上下文下,通过调整参数(Q3 量化),仍能维持 18 tok/s 的持续速度和 57 tok/s 的聚合吞吐量。
所属事件:Qwen3.8-Flash-Next 搭载 pMLX 引擎:小显存跑大模型(3 条相关)→
「Infra」频道最新
- PyTorch 2.14 发布:2995 次提交,487 位贡献者参与 — PyTorch · 2026-09-02
- Yann LeCun 呼吁加强 Neoclouds 网络安全 — ylecun · 2026-09-02
- GLM-5.3 模型推出 GGUF 量化版,适配端侧部署 — unsloth · 2026-09-02
- Asus AI PC 价格暴涨 50%,市场预测 DGX Spark 将涨价 — mountainyoo · 2026-09-02
- 用户反馈:GPT 基础设施数月未宕机,资源限制管理出色 — natesiggard · 2026-09-02
- 微软两篇 LLM 数据库相关论文获 VLDB 2026 奖项 — jm_alexia · 2026-09-02