实测 Splash 在 40 核 M5 Max 上自调内核,解码提速 20%

SeveralViolins · reddit · 2026-09-25

Reddit 用户分享对本地推理引擎 Splash 的实测:引擎默认内核规则是基于更小的芯片(16/20 核 M5、32 核 M4 Max)测量的,40 核 M5 Max 只能跑猜测值。Splash 仓库自带开发者工具 make tune-kernels,会在你的硬件上穷举每种量化矩阵乘法的运行方式。

实测发现 split-K 布局(每行输入拆 4 份、部分和最后合并)在检查 draft token 的 8 行步骤上明显更快,整体解码提升约 20%。

复现方法:从源码构建 Splash(clone 后 checkout 1.0.2、make,需 Xcode 26+ 含 Metal 工具链),再运行 tune-kernels build/splash.metallib <模型目录> --confirm,--confirm 会验证胜出的内核是否真的加速整体前向。作者已为 Inco 写了 issue #154,并在 Hugging Face 提供 Swift 模型转换(Swift-1.5-Qwen3.8-27B-Splash)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →