Mac Studio 上 DeepSeek V4 推理提速 12 倍实录
Adrian_Galilea · reddit · 2026-08-19
作者在配备 512GB 内存的 Mac Studio M3 Ultra 上运行 DeepSeek V4 Flash,将单次响应时间从 6-20 秒降至 1.6 秒。
Kernel 优化 (+21% 预填充速度)
针对 DeepSeek 稀疏注意力机制中的“lightning indexer”瓶颈,提交了三项优化 PR:
- 线程组平铺评分器
- 寄存器块驻留 K 评分器
- 流式 Top-512 替代 Bitonic 排序级联
KV Cache 预热技巧 (通用 10x 提升)
- 状态同步:客户端必须逐字节重放上一次模型输出的精确文本,否则前缀无法匹配导致每轮重新预填充。
- Prewarming:发送 maxtokens: 0 的请求。这会让引擎预填充并停顿在 Prompt 结尾,随后的真实请求即可直接扩展缓存,实现零冷启动延迟。
「Infra」频道最新
- Brex 数据:增长最快创业公司过半在卖 AI 基础设施而非 AI 产品 — FinanceYF5 · 2026-08-19
- Neon:超 80% 新数据库由 AI Agent 创建,Supabase 也超 60% — FinanceYF5 · 2026-08-19
- Neon称超80%新数据库由AI Agent创建,Agent倒逼基础设施重构 — FinanceYF5 · 2026-08-19
- 创业公司双轨并用:闭源做推理,便宜5–20倍开放模型跑批量任务 — FinanceYF5 · 2026-08-19
- 转向开放模型加速:首购算力间隔从23个月缩至5个月 — FinanceYF5 · 2026-08-19
- 开放模型到可用隔一整层技术栈,每层卖的都是「少操心」 — FinanceYF5 · 2026-08-19