64GB Mac 跑 DeepSeek V4 Flash:修补 llama.cpp 后解码达 8 tok/s

memeka · reddit · 2026-08-13

开发者在 M1 Max 64GB MacBook 上成功运行 DeepSeek-V4-Flash-0731。通过对 llama.cpp 打补丁,使用 IQ3-XXS 量化(104GB)并将上下文限制在 64k,实现了约 8 tok/s 的解码速度和 30 tok/s 的预填充速度,表现远超预期。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →