实测 Splash 在 40 核 M5 Max 上自调内核,解码提速 20%
SeveralViolins · reddit · 2026-09-25
Reddit 用户分享对本地推理引擎 Splash 的实测:引擎默认内核规则是基于更小的芯片(16/20 核 M5、32 核 M4 Max)测量的,40 核 M5 Max 只能跑猜测值。Splash 仓库自带开发者工具 make tune-kernels,会在你的硬件上穷举每种量化矩阵乘法的运行方式。
实测发现 split-K 布局(每行输入拆 4 份、部分和最后合并)在检查 draft token 的 8 行步骤上明显更快,整体解码提升约 20%。
复现方法:从源码构建 Splash(clone 后 checkout 1.0.2、make,需 Xcode 26+ 含 Metal 工具链),再运行 tune-kernels build/splash.metallib <模型目录> --confirm,--confirm 会验证胜出的内核是否真的加速整体前向。作者已为 Inco 写了 issue #154,并在 Hugging Face 提供 Swift 模型转换(Swift-1.5-Qwen3.8-27B-Splash)。
「Infra」频道最新
- 谷歌 Project Suncatcher:TPU 上太空,2027 年卫星组太空数据中心 — rohanpaul_ai · 2026-09-25
- ServingStudio 发布:模拟与优化 LLM 推理服务的工作台 — CShorten30 · 2026-09-25
- faster-qwen3-tts 支持 Apple Silicon,本地量化运行语音合成 — andimarafioti · 2026-09-25
- KV cache 为何成 GPU 显存杀手:上下文长度与并发的隐藏成本拆解 — techNmak · 2026-09-25
- 32k 上下文只跑得动 8 个本地 agent,Reddit 求多智能体实用场景 — Ambitious_Fold_2874 · 2026-09-25
- 所谓 8GB 内存是虚的?virtio balloon 揭穿云端内存超售 — joshalbrecht · 2026-09-25