Slipstream 引擎让 64GB Mac 跑 95.5GiB 大模型提速 1.76 倍至 52 tok/s
SnooPredictions515 · reddit · 2026-10-02
开发者 npanj 发布 Slipstream——一个为 Apple Silicon 打造的编译型 C++ Metal 推理引擎,原生支持 SSD 专家流式加载(expert streaming)与投机草稿(speculative drafting),让单台 64GB Mac 高速运行 95.5 GiB 的 Qwen3.8-Flash-Next 模型。
核心成绩:
- 同一份 V3 模型权重(HF 上已有 34k+ 下载),llama.cpp fork 仅 23.1 tok/s,Slipstream 达 41–52 tok/s,平均提速 1.76 倍
- 长上下文不衰减:在 3,086 次真实编码会话请求中,直到 130k token 上下文仍保持 33–44 tok/s
- 6 项任务实测(GSM8K、MATH-500、逻辑推理、Python/Rust 编码、技术写作)全面 1.65–1.82 倍加速,TTFT 也从 1,863ms 降至 1,290ms
如何使用:
bash
git clone https://github.com/npanj/slipstream.git && cd slipstream && make -j4
sudo sysctl iogpu.wiredlimitmb=59392 64GB Mac 需提高 GPU 有线内存上限
./slipstream serve --model /models/qwen38-flash-next-v3 --port 8090
- 暴露标准 OpenAI 兼容 API,可直接接 Claude Code、OpenCode 等工具
- 首次启动需 5–7 分钟预处理多分片 GGUF,之后加载约 10–15 秒
- 另提供可选的 Swift KV-Sparse 模型变体
项目开源,模型权重托管在 Hugging Face。
「Infra」频道最新
- 网友用两台 DGX Spark 加 5090 搭出全本地 LLM 电台 — jwhh91 · 2026-10-02
- 投资人吐槽:多数 neocloud 可靠性只有“九个五”,远不到五个九 — saranormous · 2026-10-02
- 传贷方要求 NVIDIA 芯片贷款需 25% 抵押,算力融资链现裂缝 — GaryMarcus · 2026-10-02
- 微软携 Snowflake 推商业指标标准化,助 AI 工具读懂企业数据 — xiaosun86 · 2026-10-02
- GLM-5.3-Flash NVFP4 的 SGLang 部署配置全公开 — TheZachMueller · 2026-10-02
- GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升 — TheZachMueller · 2026-10-02