16GB Mac 跑起Qwen3.6-35B
Senior_Nothing_4998 · reddit · 2026-07-18
本文介绍了作者把 antirez 的 ds4 runtime 扩展出一条 Metal 路径,用来在 16GB 的 M1 Pro 上运行 Qwen3.6-35B-A3B。
核心思路是:由于 Q4KS 模型约 20.8GB,无法完整常驻 16GB 机器,DS4 通过在统一内存里维护一个有界的 routed experts 缓存,并从 SSD 流式读取 miss 的专家权重,来实现可用运行。
作者给出的实测结果是:在 M1 Pro 16GB 上,production build 的四次 warm median 达到 prefill 15.04 tokens/s、generation 9.77 tokens/s,内存压力保持正常,swapout 计数没有增长。仓库还包含 runtime、ExpertMajor GGUF 布局与转换器、benchmark 细节以及已发布 GGUF 文件链接。作者强调这仍是实验性实现,但已经能在真实 16GB 机器上使用。
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11