MacBook M5 Pro 跑 DeepSeek V4 Flash 达 17 t/s
vogelvogelvogelvogel · reddit · 2026-08-06
一位开发者分享了在 MacBook M5 Pro 64GB 上本地运行 DeepSeek V4 Flash 的经验。借助 antirez 的 ds4 DwarfStar 的 SSD 流式传输模式,非路由权重常驻内存,路由专家在缓存未命中时从 SSD 拉取,从而实现了 10-17 tokens/s 的可用生成速度。
技术细节:
- 专家和输出头保持 Q80,路由、嵌入和辅助模块保持 FP16。
- 使用了 Metal 编译,并开启了 --ssd-streaming 和 --nothink 参数。
「Infra」频道最新
- RTX 3090 实测:INT8 量化让 MiniMax 视频生成提速翻倍 — Nevaditew · 2026-08-06
- 语音 AI 代理推理优化:为何 Serverless 平台难以支持? — Comprehensive_Quit67 · 2026-08-06
- Together AI 上线 Kimi K3 推理服务,多项基准测试领先 — togethercompute · 2026-08-06
- RTX 3090 跑 MiniMax H3 实测:INT8 比 FP8 快一倍且画质无损 — Nevaditew · 2026-08-06
- 后训练优化任务 Token 效率,可直接降低 10% 推理成本 — ypatil125 · 2026-08-06
- Jeff Dean 等科学家因 TPU 限制研究而离开 Google — firstadopter · 2026-08-06