MacBook Pro 跑 DeepSeek:量化后实测近 40 tokens/s

victormustar · x · 2026-08-03

开发者在搭载 M5 Max 芯片的 MacBook Pro 上,成功实现了 DeepSeek 模型的高效本地推理。在处理超过 1.5 万长上下文的情况下,速度依然能达到 36 到 55 tokens/s。

这一惊人的运行效率主要得益于结合了 @unsloth 的 UD-Q2KXL 量化版本以及 @ggmlorg 的 MXFP4 DSpark 草稿模型(推测加速)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →