64GB Mac 跑 DeepSeek V4 Flash:修补 llama.cpp 后解码达 8 tok/s
memeka · reddit · 2026-08-13
开发者在 M1 Max 64GB MacBook 上成功运行 DeepSeek-V4-Flash-0731。通过对 llama.cpp 打补丁,使用 IQ3-XXS 量化(104GB)并将上下文限制在 64k,实现了约 8 tok/s 的解码速度和 30 tok/s 的预填充速度,表现远超预期。
「Infra」频道最新
- Heron Power 投资超 1 亿美元建厂,专攻 AI 数据中心电网技术 — espricewright · 2026-08-13
- SK海力士等三大原厂2027年HBM产能已全部售罄 — Beth_Kindig · 2026-08-13
- NVIDIA发布AI代币经济学指南:算力如何转化为收入 — nvidia · 2026-08-13
- 黄仁勋定义 AI 时代:AI 工厂是新基建,Token 是新商品 — nvidia · 2026-08-13
- Kubernetes DRA 达 GA:原生支持 GPU 切分调度 — sloppenheimer · 2026-08-13
- SanDisk 预期长期毛利率达 80%,营收将增长至 2030 年 — firstadopter · 2026-08-13