128GB Mac 跑 341GB DeepSeek:砍代码库让 agent 提速 2 倍
Chida82 · reddit · 2026-10-08
作者在 128GB M5 Max Mac 上跑 341GB 的 DeepSeek V4.1 Flash(Q2 量化,靠 ds4 从 SSD 流式加载专家权重),原版仅 12 tok/s。他没有先写 kernel,而是用编码 agent 做了一件更根本的事:把代码库缩小到 agent 能驾驭的规模。
- 裁剪代码库:ds4.c 原本 85k 行、三套模型家族、三种 GPU 后端,agent 每个会话都要重读大部分无关代码。作者直接物理删除无关部分(保留 Metal 后端),ds4.c 降到 34k 行,全树从 278k 降到 150k,单次优化实验成本从一下午降到约一小时。
- 硬性验证规则:输出必须与上游逐 bit 一致(greedy、10 个 prompt),每次改动跑 A/B/B/A 对比并比对 logits,不做 KV 量化、不用近似 kernel。
- 具体优化(每个都是小 diff):decode 层间 GPU 提交不互相等待;专家读取用线程池拆分 + Metal residency set 缓存;每 token 若干 kernel 融合;prefill 时提前读取下一层专家权重。
- 双 SSD 拆分读取:GGUF 复制一份到外接 Thunderbolt 5 SSD,prefill 时从两块盘并行读取每层的一部分;启动时校验副本(约 7 秒),不一致拒绝运行。
- 结果:decode 从 12.1 提升到 24.4 tok/s(约 2 倍),16k→32k prefill 从 404 到 636 tok/s,prefill 后首 token 从 2.1–3.0 秒降到 0.3–1.1 秒,硬件零投入。
「编程与Agent」频道最新
- iOSWorld 亮相 COLM 2026:专注 iOS 环境的计算机使用 Agent 基准 — kohjingyu · 2026-10-08
- 开源模型即开即聊:无需配置无需 API key,一条 ssh 命令搞定 — mishig25 · 2026-10-08
- 程序员自嘲三部曲:不写代码、不读代码、如今连agent输出都不读了 — KevinNaughtonJr · 2026-10-08
- Instinct 携手 Sierra 与 Decagon,让个人 Agent 直连企业客服 — saranormous · 2026-10-08
- HeyGen 演示用 ChatGPT 一个 Prompt 为宾客生成个性化视频邀请 — HeyGen · 2026-10-08
- Google 展示 Antigravity 串联 Stitch MCP 与 Android CLI 开发流程 — tokumin · 2026-10-08