DeepSeek 4.1 Flash 全精度跑上 Mac:4 颗 Max-Q 达 200 TPS
TheZachMueller · x · 2026-09-11
有开发者实测 DeepSeek 4.1 Flash 以全精度配合 DSpark 引擎,在 4 颗 Apple Max-Q 芯片、仅 64GB 系统内存的机器上跑出约 200 TPS 的速度。
关键技巧是把约 200GB 的 Engram(本质是一张哈希表)offload 到 NVMe 而非全部常驻内存,效果出乎意料地好、成本大幅降低。作者表示还有优化空间,vLLM 的复现配方即将放出。
所属事件:DeepSeek V4.1 Flash 多场景实测:近前沿性能、超低成本(15 条相关)→
「Infra」频道最新
- Google 宣布在芬兰投资 150 亿美元建设 AI 基础设施 — LinkedInNews · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- 作者自制 KiCad 封装库,让 AI 芯片 DIY 原型板更好布线 — debreuil · 2026-09-11
- 从业者爆料:LLM 推理服务商毛利极薄,月营收1万美元仅赚200美元 — metalvendetta · 2026-09-11
- kimi k3 或采用同置异步 RL,v4 批次不变性设计引猜测 — stochasticchasm · 2026-09-11
- Peter Diamandis:AI 竞赛正变成我们这代最大的基建工程 — PeterDiamandis · 2026-09-11