Mac本地跑DeepSeek V4 Flash:M3 Ultra实测达43 tok/s
Professional-Bear857 · reddit · 2026-08-04
一位开发者在 Reddit 分享了在 Mac(M3 Ultra, 192GB+ 内存)上运行 DeepSeek V4 Flash 的目前最优量化方案。
- 模型与工具:使用了 Hugging Face 上的 Vontra/DeepSeek-V4-Flash-0731-MXFP4-MLX 量化版本,支持 dspark/mtp。
- 性能表现:生成速度随着上下文缓存增加而提升,从初始的 34 tok/s 提升到了 43 tok/s。测试包含了默认对话提示和 13k 长度的查询。
「Infra」频道最新
- 蔡司表态:能应对AI关键零部件激增的需求 — pstAsiatech · 2026-08-04
- 硬核实测预告:不同 PCIe 与 GPU 配置下的本地大模型性能对决 — TheZachMueller · 2026-08-04
- 本地跑 MiniMax 视频卡顿?探讨 ComfyUI 渲染时的 GPU 预留方案 — NetworkSpecial3268 · 2026-08-04
- 台厂扩产墨西哥:服务器成对美出口主力,支撑 AI 算力 — pstAsiatech · 2026-08-04
- 曝谷歌为 Anthropic 撑起 2000 亿美元算力融资 — firstadopter · 2026-08-04
- MCP 旧版 SSE 传输致 Serverless 账单飙升,开发者警告排查闲置连接 — Ranorkk · 2026-08-04