M3 Ultra 跑 DeepSeek V4.1 Flash 提速近一倍:31 t/s 解码、40 t/s 投机
IngeniousIdiocy · reddit · 2026-09-15
作者 fork 了 antirez/ds4 并针对 512GB M3 Ultra 上的 DeepSeek V4.1 Flash(Q4)做了首个公开的 DSpark Apple Metal 实现,实测 91 分钟 agent 回合:解码 101k tokens、prefill 460 万 tokens(99.5% 缓存命中)、56 次工具调用零失误。
对比上游 ds4(同机同权重):
- 解码 8k 上下文:16.6 → 31.3 t/s;300k 上下文:14.0 → 28.3 t/s
- Prefill 62k prompt:737 → 813 t/s;磁盘 KV 缓存恢复 0.23 秒(冷启 31 秒)
- DSpark 投机解码:代码 32.1 → 40.5 t/s,agent 回合 31.3 → 41.3 t/s
技术要点:
- 解码:每 token 需读约 14GB 权重,700GB/s 带宽上限约 50 t/s,瓶颈是数百次小 dispatch 而非矩阵运算;合并所有层到单一 command buffer、384-expert 路由一次 dispatch、共享专家门控+SwiGLU 合一 kernel、BF16 取整内联省去约 770 次重复 dispatch
- 长上下文:V4.1 压缩注意力的 512-block 选择链占长上下文减速的 98%,改为每层只评分 mask 允许的块并用有界基数选择,300k 解码达 8k 速度的 90%
- Prefill:受计算限制(Metal GEMM 约 23-24 TFLOPS,M5 前 TensorOps 被禁用),只提升 10%;每 8k 块写可续 checkpoint
- DSpark:6 行验证共享权重流,验证块 177→112ms,权重带宽 213→337GB/s;temperature>0 时精确投机采样
- 正确性:greedy 解码输出与上游逐字节一致,repo 提供 SHA-256 manifests 可复现
「编程与Agent」频道最新
- 「点子能活,代码必死」:AI 时代代码正沦为一次性消耗品 — yenkel · 2026-09-15
- 不信任写代码的 agent,为何信审查它的 agent? — thomasahle · 2026-09-15
- 远程 IDE px0 新增全工作区毫秒级全文搜索与项目秒开 — arpit_bhayani · 2026-09-15
- Cloudflare Workers 推出细粒度授权,可为 Agent 单独设四种角色权限 — dinasaur_404 · 2026-09-15
- 编码工具选哪个不重要,深入用好一个才是关键 — iannuttall · 2026-09-15
- Hypothesis 作者在 Antithesis 招人:伦敦驻地开发 Hegel — xuanalogue · 2026-09-15