antirez 双 MacBook 经 RDMA 跑 DeepSeek v4.1 Flash 达 25 token/秒
antirez · x · 2026-09-11
antirez 继续实验在两台 MacBook 上运行 DeepSeek v4.1 Flash:
- 通过 RDMA 做张量并行(每台机器承担 50%),拿到 25 token/秒 的生成速度;作为对比,单机 SSD 流式加载只有 15 t/s。
- 他指出这个“怪异”的 LLM 在 prefill 阶段不用 decoder 部分,因此 128GB 机器可以把 prefill 所需的全部层完全常驻内存,对大 prefill 场景可以进一步优化。
- 他认为这个用例下还有很大优化空间。
所属事件:antirez 用双 MacBook 经 RDMA 本地跑 DeepSeek v4.1 Flash(3 条相关)→
「Infra」频道最新
- Claude Desktop 数据直传大厂?用 Ollama 本地模型保住隐私 — Technovangelist · 2026-09-11
- LithosAI 上线 DeepSeek-V4.1-Flash Day-0 推理,单用户 250 tokens/s — JiaZhihao · 2026-09-11
- 1 分 26 秒连续航拍 AI 视频,全流程 Mac 本地生成 — cocktailpeanut · 2026-09-11
- KV Cache 也做 QAT?技术拆解解释某模型 fp4 精度下表现更好 — stochasticchasm · 2026-09-11
- 网友猜测 Anthropic 走谷歌加部分 AWS,OpenAI 绑定微软 Azure — ericwdolan · 2026-09-11
- 英伟达:Vera Rubin 每 MW 吞吐为 Blackwell Ultra 的 50 倍,token 成本降 35 倍 — Beth_Kindig · 2026-09-11